Agenta Kostenlos

-

Agenta ist eine Open-Source-Engineering-Plattform für und LLM-Anwendungen, die Teams bei der Standardisierung des Evaluierungs- und Freigabeprozesses unterstützt. Es deckt vier Hauptfunktionsmodule ab: schnelles Wortmanagement, systematische Auswertung, Online-Beobachtung und Agenten-Orchestrierung und unterstützt den Zugriff auf über 50 LLM-Modelle und die selbst gehostete Bereitstellung.

Agenta Produktoberfläche

Agenta: Open-Source-LLMOps-Evaluierungs- und Veröffentlichungsplattform

Kernparameter und Statistiken

Agenta ist eine Open-Source-LLMOps-Plattform für LLM-Anwendungsentwicklungsteams. Offiziell als „Open-Source-LLMOps-Plattform“ positioniert, integriert Agenta die vier Leistungsbereiche Prompt Word Engineering, systematische Auswertung, Online-Beobachtung und Agent-Orchestrierung in einem einzigen Produkt. Es handelt sich nicht nur um einen „besseren Eingabeaufforderungseditor“, sondern um ein Tool auf Plattformebene, das die LLM-Anwendungsentwicklung von einem manuellen, verteilten und nicht reproduzierbaren Prozess zu einem systematischen, messbaren und nachvollziehbaren Engineering-Prozess aufwertet.

Projekt Spezifikationen
Modell-/API-Name Agenta
Produkttyp Open-Source-LLMOps-Plattform
Lieferform Cloud SaaS + Open-Source-Selbsthosting (Docker Compose)
Kontextlänge Abhängig vom angeschlossenen LLM-Modell
Unterstützung modal Text (prompte Wortentwicklung + Bewertung + Beobachtung + Agentenvereinbarung)
Open-Source-Lizenz MIT-Lizenz
GitHub-Sterne ~4.300
GitHub Forks 572
Mitwirkende 95+
Gesamtveröffentlichungen 417+ Veröffentlichung
Neueste Version v0.105.3 (17.07.2026)
Technologie-Stack TypeScript 57,7 % + Python 41,2 %
Unterstützte Plattformen Web, API, Docker
Ort der Zugehörigkeit Deutschland (Agentatech UG)
Preismodell Kostenlos (selbst gehostet) + kostenloses Kontingent (SaaS Hobby) / Pro / Business / Enterprise

Interpretation der Kernparameter: Die „Fähigkeiten“ von Agenta ergeben sich nicht aus einem einzelnen Modell, sondern aus seiner Plattformarchitektur. Die Möglichkeit, den Zugriff auf über 50 LLM-Modelle zu unterstützen, bedeutet, dass Teams nicht an einen einzigen Anbieter gebunden sind. Die Community-Aktivität von 417 Releases und 95 Mitwirkenden zeigt, dass das Projekt das frühe experimentelle Stadium überschritten hat und ein stabiles Ökosystem für externe Beiträge gebildet hat. In der vergangenen Woche wurden kontinuierlich vier Versionen (v0.105.0~v0.105.3) veröffentlicht. Die Kernfunktionen wurden intensiv iteriert, und das Agenten-Orchestrierungs- und Beobachtungspanel sind die aktuellen Hauptlinien.

Modellunabhängiges Design: Unterstützt den Zugriff auf jede Modell-API über eine benutzerdefinierte Anbieterschnittstelle, und das Team kann während des Bewertungsprozesses frei zwischen den verschiedenen Modellen wechseln und deren Leistung vergleichen – dies ist besonders wichtig für Unternehmen mit Multi-Modell-Strategien.

Benutzer- und Markterkennung

Die Marktbekanntheit von Agenta beruht in erster Linie auf der tatsächlichen Akzeptanz durch die Open-Source-Community und die LLM-Ingenieurteams und nicht auf öffentlichen Einnahmen oder Kundenzahlen (letztere werden nicht offiziell bekannt gegeben).

Beliebtheit in der Open-Source-Community: GitHub hat derzeit etwa 4.300 Sterne und 572 Forks, und 417 Veröffentlichungen deuten darauf hin, dass sich das Projekt in einer Hochfrequenz-Iterationsphase befindet. Zu den 95 Mitwirkenden gehören das Kernteam und externe Community-Mitwirkende, und Problem-Feedback und Funktionsverbesserungen unterliegen einer gewissen externen Überprüfung. Es werden die offizielle Slack-Community, GitHub-Diskussionen und eine öffentliche Roadmap bereitgestellt, und die Community-Reaktion ist relativ aktiv.

Zielkundengruppe: Offiziell werden „Produktmanager, Entwickler und Domänenexperten“ als Zielbenutzer aufgeführt, was darauf hinweist, dass das Designziel nicht ein einzelnes Entwicklertool, sondern eine rollenübergreifende LLM-Engineering-Kollaborationsplattform ist. Das Schlüsselwort Produktpositionierung wurde von „Prompt Management“ auf „LLMOps-Plattform“ hochgestuft, was zeigt, dass sich seine Abdeckung von Prompt Word Management auf vollständiges Lebenszyklusmanagement ausgeweitet hat.

Voraussetzungen für die Implementierung: Damit plattformbasierte LLMOps-Tools ihren Wert wirklich entfalten können, muss das Team normalerweise über einen klaren LLM-Anwendungsentwicklungsprozess verfügen (prompte Word-Iteration, Bewertungsregression, Online-Überwachung) und bereit sein, Experimente, Bewertungs- und Beobachtungsdaten auf einer Plattform zu vereinen. Für Teams, die immer noch „überall verstreute Eingabeaufforderungen + manuelle Sichtprüfung“ verwenden, wird der standardisierte Prozess von Agenta selbst normative Bindung bringen.

Wettbewerbspositionierung in der Branche: Agenta ist als „Open-Source-Allrounder“ im LLMOps-Tool-Ökosystem positioniert – im Vergleich zu LangSmith (geschlossene Quelle, LangChain-ökologische Bindung), Weights & Biases Prompts (geschlossene Quelle, starke experimentelle Nachverfolgung) und Helicone (beobachtungsspezifisch, Open-Source) ist Agenta eine der wenigen Optionen, die gleichzeitig die Fünf-in-Eins-Anforderungen „Open Source + promptes Wortmanagement + Bewertung + Beobachtung + Agent“ erfüllt.

Kostenvorteil

Agenta bietet einen zweigleisigen Kostenpfad: „Null Kosten für Open-Source-Hosting + kostenloser Cloud-Kontingenteintritt“. Der Kernwert liegt darin, die Schwelle der LLMOps-Plattform von „SaaS auf Unternehmensebene mit Tausenden von Dollar pro Monat“ auf „Null Kosten für den Start“ zu senken.

Kostenhierarchie Preismethode Explizite Kosten Implizite Kosten
C-Seite / Einzelentwickler Hobby (kostenlos) 0 $, 2 Plätze, 20 Auswertungen/Monat, 5.000 Spuren/Monat 30 Tage Datenaufbewahrung, kein SLA, nur Community-Support
Entwickler/Kleines Team Pro (49 $/Monat) 3 Plätze (20 $/zusätzlicher Platz), 10.000 Spuren/Monat, unbegrenzte Auswertung Extra Trace 5 $/10.000, 90-Tage-Reservierung
Geschäftsteam Geschäft (399 $/Monat) Unbegrenzte Plätze, 1 Mio. Spuren/Monat, RBAC, SOC2, SSO 365-tägige Aufbewahrung, privater Slack-Kanal
Unternehmen / Privatisierung Unternehmen (Geschäftsangebot) BYOC, selbst gehostet, Prüfprotokolle, benutzerdefiniertes SLA Geschäftsbestätigungsbedingungen und DPA erforderlich
Selbstgehostet (Open Source) Kostenlos (MIT-Lizenz) Software 0 $, nur Infrastrukturkosten Betriebspersonal (PostgreSQL + Redis + Multi-Container-Orchestrierung)

Die wahren Kosten des Selbsthostings: Der selbstgehostete Pfad ist auf Lizenzebene (MIT) kostenlos, die Infrastrukturkosten werden jedoch vom Unternehmen getragen. Nehmen Sie als Beispiel die Docker Compose-Bereitstellung. Das Backend basiert auf PostgreSQL + Redis und kann auf einer einzelnen Maschine ausgeführt werden. In Szenarien mit hoher Parallelität müssen jedoch der Datenbankverbindungspool und die Containerressourcenzuweisung berücksichtigt werden (eine Cloud-Instanz mit mindestens 4 Kernen und 8 GB RAM wird empfohlen). Selbst-Hosting bedeutet auch, dass das Team Versions-Upgrades (1–2 Releases pro Monat), Datensicherungen und Sicherheitspatches selbst verwalten muss. Im Vergleich zu den 399 US-Dollar/Monat des Business-Plans bietet Selbsthosting bei großem Umfang Kostenvorteile, allerdings nur, wenn das Team über die entsprechenden Betriebs- und Wartungskapazitäten verfügt.

Die kostenlose Wahrheit: Der Cloud-Hobby-Plan ist völlig kostenlos, aber der kostenlose Plan bietet keine SLA-Garantien und erweiterten Sicherheitsfunktionen (RBAC, SSO, SOC2) und die Trace-Aufbewahrungsfrist beträgt nur 30 Tage. Für den ernsthaften Einsatz in Produktionsumgebungen ist der Pro-Plan (49 $/Monat) ein vernünftiger Ausgangspunkt. Vergleich mit kommerziellen Mitbewerbern: Der Starter-Plan von LangSmith beginnt bei 25 $/Monat, verfügt aber über begrenzte Funktionen und begrenztes Trace-Volumen, die Enterprise-Version von W&B kostet normalerweise 100 $+/Sitzplatz/Monat und der Pro-Plan von Agenta liegt im Vergleich zu seinen Mitbewerbern auf einem mäßig niedrigen Niveau.

Hauptfunktionen

Die Fähigkeiten von Agenta sind darauf ausgelegt, „die LLM-Anwendungsentwicklung von einem manuellen, verteilten und nicht reproduzierbaren Prozess zu einem systematischen, messbaren und nachvollziehbaren Engineering-Prozess zu verbessern“. Die Kernfunktionen lassen sich in fünf Hauptmodule zusammenfassen. Jeder Funktionspunkt folgt der Kausalkette „Mechanismus → Wirkung → Szene“.

  • 🧪 Prompt Management und Engineering: Mechanismus – Bietet einen interaktiven Spielplatz, der den direkten Vergleich der Leistung mehrerer Modelle/Prompt-Wortvarianten in Testfällen in derselben Schnittstelle unterstützt. Vollständiger Versionsverlauf, unterstützt Verzweigung und Umgebungsmanagement (Staging/Produktion). Fachexperten können Aufforderungswörter sicher über die Benutzeroberfläche bearbeiten, ohne den Code zu berühren. Auswirkung – Die Iteration des Eingabeaufforderungsworts wird von „Änderung des Ingenieurhandbuchs → visuelle Inspektion → Bereitstellung“ auf eine geschlossene Schleife von „UI-Bearbeitung → automatische Bewertung → Freigabe mit einem Klick“ verkürzt. Szenario – Der KI-Produktmanager vergleicht die Ausgabeunterschiede von GPT-4o und Claude auf demselben Testsatz von drei Prompt-Wort-Varianten im Playground und wählt die Kombination mit der besten Leistung für die Online-Veröffentlichung aus.

  • 📊Systematische Bewertung (Bewertung): Mechanismus – von „manueller Sichtprüfung“ auf einen wiederholbaren Bewertungsprozess umgestellt. Unterstützt das Erstellen von Testsätzen (Testsets) aus Produktionsdaten, Spielplatzexperimenten oder CSV-Uploads. Integrierte über 20 voreingestellte Evaluatoren (einschließlich LLM-as-Judge, Genauigkeitsbewertung, Korrelationsbewertung, Sicherheitsprüfung) und unterstützt auch benutzerdefinierte Code-Evaluatoren (Python-Funktionen). Bewertungen können jeden Zwischenschritt der Argumentation des Agenten abdecken, nicht nur die endgültige Ausgabe. Effekt – Ändern Sie die Bewertung von „subjektiver Beurteilung“ zu „reproduzierbaren quantitativen Indikatoren“. Bei jeder Änderung des Aufforderungsworts sind die Auswirkungen auf die Qualitätsindikatoren sofort erkennbar. Szenario – Nachdem der Prompt-Word-Ingenieur die Systemaufforderung des Kundendienstroboters geändert hatte, wurde automatisch eine Batch-Evaluierungspipeline mit 200 Testfällen ausgelöst. Nach 5 Minuten ging eine Meldung ein, dass die Genauigkeitsrate von 87,3 % auf 91,1 % gestiegen sei.

  • 📡 Online-Beobachtbarkeit: Mechanismus – Bietet Trace auf Anforderungsebene, um Fehlerknoten genau zu lokalisieren. Verfolgen Sie die Kosten, Latenz und Nutzungsmuster jedes LLM-Anrufs. Unterstützt das native Protokoll OpenTelemetry und ist mit den Standards OpenLLMetry und OpenInference kompatibel. Benutzer-Feedback kann im Trace markiert werden und der abnormale Trace kann durch Klicken darauf in einen Testfall umgewandelt werden, wodurch die geschlossene Feedback-Schleife abgeschlossen wird. Auswirkung – Sobald eine LLM-Aufrufausnahme online auftritt, kann sie innerhalb von 30 Sekunden lokalisiert werden, unabhängig davon, ob es sich um ein Prompt-Problem, ein Modellproblem oder ein Kontextproblem handelt, anstatt die Protokolle Schritt für Schritt zu überprüfen. Szenario – Der Betriebs- und Wartungsingenieur stellte im Beobachtungspanel fest, dass die Verzögerung eines API-Endpunkts von 2 Sekunden auf 8 Sekunden anstieg. Die Trace-Details zeigten, dass der Kontext zu lang war, was zu einem starken Anstieg des Token-Verbrauchs führte. Mit einem Klick wurde der Trace in einen Testfall umgewandelt und in das Regressionsset aufgenommen.

  • 🤖 Agent Orchestration (Agent Capabilities) : Mechanismus – Der Schwerpunkt der Iteration 2026 unter Verwendung der dreischichtigen Architektur „Harness + Skill + Tool“. Agent Harness ist ein laufender Container, der Modellverbindungen und Sandbox-Lebenszyklen verwaltet; Skill ist ein wiederverwendbares Fähigkeitsmodul. Tool ist eine spezifische Ausführungseinheit, die externe Systeme über MCP oder interne Gateways aufruft. Unterstützt den Genehmigungsprozess der manuellen Bestätigung (HITL) und die Steuerung der Tool-Aufrufberechtigungen. Effekt – Agenta wird von einer „Evaluierungsplattform“ zu einer „Agentenentwicklungs-, Betriebs- und Wartungsplattform“ erweitert, und das Team kann den Aufbau, die Evaluierung, die Online-Überwachung und die Überwachung des Agenten auf derselben Plattform abschließen. Szenario – Der Entwickler erstellt einen „Customer Service Agent“ in Agenta, konfiguriert Claude Sonnet als Inferenz-Engine, stellt eine Verbindung zum CRM-System als Tool her, richtet die HITL-Genehmigung ein (nur Rückerstattungsvorgänge erfordern eine manuelle Bestätigung), führt eine Batch-Auswertung durch und veröffentlicht sie dann online.

  • 👥Teamzusammenarbeit (Zusammenarbeit): Mechanismus – Bereitstellung differenzierter Schnittstellen für verschiedene Rollen – Ingenieure verwenden API/SDK, um programmgesteuerte Vorgänge durchzuführen, und Produktmanager und Fachexperten führen Überprüfungen durch und bearbeiten Eingabeaufforderungswörter über die Benutzeroberfläche. Alle Vorgänge werden auf einer einheitlichen Plattform zentralisiert, um die Informationsfragmentierung zwischen den Tools zu reduzieren. Die Berechtigungskontrolle setzt RBAC auf Projektebene außer Kraft. Effekt – Beseitigt die Reibungsverluste bei der Zusammenarbeit, die entstehen, wenn „der Produktmanager die Eingabeaufforderung ändert und sie dann zur manuellen Bereitstellung an den Techniker sendet“. Alle Änderungen verfügen über Versionseinträge und Genehmigungslinks. Szenario – Der Produktmanager hat die Kundendienstaufforderung in der Benutzeroberfläche optimiert und als Version 2.3 gespeichert. Das System löste automatisch die Bewertung aus und der Ingenieur erhielt den Genehmigungsbescheid. Nach der Bestätigung wurde es mit einem Klick in die Produktionsumgebung freigegeben.

Synergie zwischen Funktionen: Diese fünf Module bilden einen geschlossenen Kreislauf aus „Experiment → Bewertung → Beobachtung → Feedback → Optimierung“. Ausnahmen in der Produktion Trace → Konvertierung mit einem Klick in Testfälle → Playground-Änderung Eingabeaufforderung → Automatische Bewertung → Versionsverwaltung → Bereitstellung und Online → Kontinuierliche Überwachung durch Beobachtungspanel. Dieser geschlossene Regelkreis komprimiert den Iterationszyklus von LLM-Anwendungen von „Tagen/Wochen“ auf „Minuten/Stunden“.

Modell- und Versionsentwicklung

Die Versionsiteration von Agenta folgt dem Rhythmus der semantischen Versionierung (SemVer) plus häufigen inkrementellen Releases. Vom frühen Open-Source-Kern bis zur aktuellen Hauptlinie der Agent-Funktionen werden vier wichtige Übergänge abgedeckt.

Version Datum Wichtige Änderungen
v1 (Open-Source-Grundlage) 2024-01 Open-Source-Kernversion, interaktiver Playground-Vergleich und grundlegende Bewertungsfunktionen
v0.58.0 2025-10 Verzeichnisstruktur der Enterprise Edition (ee), Unterstützung für mehrere Organisationen, RBAC-Grundgerüst
v0.84.0-Serie 2025~2026 Batch-Auswertungspipeline, Regressionsvergleichsbericht, Beobachtungspanel-Alarmmechanismus und Trace-Details
v0.103.x-Serie 2026-06 RBAC wurde von ee auf OSS umgestellt, UI-Optimierung (Testsatzverwaltung, Evaluator-Navigation, Batch-Archivierung)
v0.104.0 2026-06 Multi-Organisation-Funktionen kommen in OSS, Enterprise Self-Hosting Multi-Team-Unterstützung
v0.105.0 14.07.2026 Zusammengeführte Hauptlinie der Agentenfähigkeiten, neues Agentenpanel, Skillsystem, MCP-Tool, Sandbox-Ausführung, HITL
v0.105.3 17.07.2026 [Neueste] Agent Playground-Sitzungsverwaltung, Datei-Upload und Erweiterungen der Inspektorfunktion

Merkmale der Versionsentwicklung: Der Versionsrhythmus von Agenta weist ein Hochfrequenzmuster von „Hauptlinie einmal alle zwei Wochen, Hotfixes zweimal pro Woche“ auf. Allein von Juni bis Juli 2026 wurden mehr als 10 Versionen veröffentlicht, wobei die v0.105.x-Serie innerhalb einer Woche aufeinanderfolgende Iterationen von 0.105.0 auf 0.105.3 abschloss. Dieser Rhythmus bedeutet, dass es bei einer Produktionsbereitstellung empfohlen wird, eine verifizierte offizielle Version für die Abschlussbewertung zu reparieren, anstatt jedes Update direkt zu verfolgen.

Roadmap-Bewertung: Aus der Versionsentwicklung geht hervor, dass die Produktprioritäten von Agenta folgende sind: Schnelle Wortverwaltung (Grundlagen) → Bewertungssystem (Kernbarrieren) → Beobachtungspanel (Differenzierung) → Agenten-Orchestrierung (neue Wachstumskurve). Die Einführung der Agent-Funktionen markiert die Aufwertung der Positionierung von Agenta vom „LLM-Bewertungstool“ zur „Plattform für den gesamten Lebenszyklus von LLM-Anwendungen“ – eine strategische Richtung, die Aufmerksamkeit verdient.

Technische Vorteile

Der technische Vorteil von Agenta ergibt sich nicht aus der Leistung eines einzelnen Modells, sondern aus der Kombination der drei Dimensionen „architektonische Offenheit + Full-Link-Closed-Loop + modellunabhängiges Design“.

Architekturvereinheitlichung und Rollenanpassung: Agenta deckt Prompt-Word-Engineering, Evaluierung, Beobachtung und Agenten-Orchestrierung über dieselbe API und Benutzeroberfläche ab, anstatt mehrere unabhängige Tools zusammenzufügen. Ingenieure können den Evaluierungs- und Bereitstellungsprozess über das Python SDK („pip install agenta“) in die CI/CD-Pipeline einbetten; Produktmanager und Domänenexperten führen tägliche Experimente und Bewertungen über die Web-Benutzeroberfläche durch. Vollständige API- und UI-Parität bedeutet, dass jeder Vorgang auf zwei Arten abgeschlossen werden kann – dies ist eine wichtige Architekturentscheidung für Tools auf Plattformebene, die die Fähigkeitslücke vermeidet, „was die UI tun kann, die API aber nicht“.

Modellunabhängiges Bewertungsframework: Die Abstraktionsschicht des Evaluators (Evaluator) unterstützt drei Modi: LLM-as-Judge (verwenden Sie ein anderes großes Modell, um die Qualität der Ergebnisse zu beurteilen), integrierte über 20 voreingestellte Evaluatoren (die Dimensionen wie Genauigkeit, Relevanz, Sicherheit usw. abdecken) und benutzerdefinierte Code-Evaluatoren (Python-Funktionen). Die Bewertung kann auf jeden Zwischenschritt der Argumentation des Agenten einwirken, anstatt nur die endgültige Ausgabe zu untersuchen. Der Evaluator im SDK wird in einer Sandbox-Umgebung (RestrictedPython) ausgeführt, um die Ausführung von Schadcode zu verhindern.

Offener Technologie-Stack: Das Beobachtungsmodul basiert auf dem nativen OpenTelemetry-Protokoll und ist mit den Standards OpenLLMetry und OpenInference kompatibel. Dies bedeutet, dass Anwendungen, die bereits mit OpenTelemetry verbunden sind, Trace-Daten ohne Änderungen an Agenta senden können. Bietet sofort einsatzbereite Integration für gängige Frameworks wie LangChain, LlamaIndex und mehr. Die benutzerdefinierte Provider-Schnittstelle ermöglicht den Zugriff auf jede Modell-API, sofern das Standard-Aufrufprotokoll implementiert ist.

Architektonische Weiterentwicklung der Agentenfunktionen: Das in v0.105.0 im Jahr 2026 eingeführte Agenten-Subsystem übernimmt eine dreischichtige Architektur aus „Harness + Skill + Tool“. Agent Harness ist ein laufender Container, der Modellverbindungen und den Sandbox-Lebenszyklus verwaltet; Skill ist ein wiederverwendbares Fähigkeitsmodul, das beschreibt, was der Agent tun kann; Tool ist eine spezifische Ausführungseinheit, die externe Systeme über MCP oder interne Gateways aufruft. Der HITL-Genehmigungsprozess ist auf „menschliche Verzögerungen“ ausgelegt – es gibt eine Downgrade-Strategie (automatische Ablehnung oder regelbasierte automatische Genehmigung), nachdem die Genehmigung abgelaufen ist.

Anpassungsgrenzen und -beschränkungen

Agenta bietet eine vollständige Toolkette in der LLMOps-Welt, aber nicht alle LLM-Entwicklungsszenarien erfordern seine vollen Fähigkeiten.

Empfohlene Nutzungsszenarien: – Das Team verfügt über mehrere LLM-Anwendungslinien, die eine einheitliche Verwaltung benötigen.

  • Messmetriken wurden oder sollen in den CI/CD-Prozess integriert werden.
  • Ein systematischer Vergleich und ein Versionsmanagement zwischen mehreren Modellanbietern sind erforderlich.
  • Erstellen oder Warten von LLM-Produktionsanwendungen, die eine kontinuierliche Überwachung erfordern.
  • Anforderungen an die Datensouveränität erfordern eine selbst gehostete LLMOps-Plattform.

Nicht empfohlenes Szenario:

  • Das Team verfügt nur über 1–2 einfache LLM-Aufrufe (z. B. eine einzelne Übersetzungs- oder Zusammenfassungsfunktion) und erfordert keine Versionsverwaltung und systematische Auswertung.
  • Es gibt überhaupt kein Bewertungsbewusstsein und keinen Bewertungsprozess (das heißt: „Machen Sie einfach weiter, wenn Sie Änderungen vornehmen, und kümmern Sie sich später um die Probleme“). Der standardisierte Prozess von Agenta erfordert zusätzliche organisatorische Anpassungskosten. – Es ist nur eine grundlegende Prompt-Verwaltung erforderlich, keine Beobachtung und Agenten-Orchestrierung erforderlich – einfachere Tools (wie PromptHub, HumanLoop) sind möglicherweise besser geeignet.
  • Die Kernanforderung ist die Feinabstimmung des Modells und nicht die schnelle Wortentwicklung. - Agenta bietet keine schulungsbezogenen Funktionen und sollte mit Feinabstimmungsplattformen (wie Weights & Biases) verwendet werden.

Bekannte Einschränkungen:

  • Die Funktion zur Agenten-Orchestrierung (v0.105.x) befindet sich noch in einer schnellen Iterationsphase, die Stabilität der HITL-Genehmigung und der MCP-Tool-Erkennung wird noch verbessert und die Überprüfungszeit muss für die Bereitstellung in der Produktionsumgebung reserviert werden.
  • Die Bewertungskriterien von Bewertern (insbesondere LLM als Richter) erfordern, dass das Team Zeit in die Kalibrierung investiert, andernfalls kann die automatische Bewertung von der menschlichen Beurteilung abweichen. – Die Betriebs- und Wartungskomplexität der selbstgehosteten Version kann nicht ignoriert werden – PostgreSQL, Redis und Multi-Container-Orchestrierung erfordern spezialisiertes Betriebs- und Wartungspersonal.
  • Die Anzahl der Firmenkunden, Umsatzdaten und spezifische Benutzerebenen wurden nicht offiziell bekannt gegeben. Die kommerzielle Verifizierung erfordert eine transparentere Offenlegung von Informationen.
  • Es besteht die Gefahr, dass sich die Funktionslücke zwischen der Open-Source-Version und der Enterprise-Version vergrößert – Enterprise-Funktionen wie SSO und SOC2 sind nur in der Enterprise-Version verfügbar.

Wie man es benutzt

So verwenden Sie Geeignet für die Menge Erste Schritte Kosten
Cloud-SaaS Teams, die eine schnelle Validierung anstreben Besuchen Sie cloud.agenta.ai, um sich anzumelden Hobby Kostenlos / Pro 49 $/Monat
Selbsthosting (Docker Compose) Organisationen mit hohen Daten-Compliance-Anforderungen git clone → Konfiguration .env → Docker compose up -d Infrastrukturkosten
Python-SDK Ingenieure, die CI/CD-Integration benötigen pip install agenta API auf Abruf oder selbst gehostet
API-Zugriff Programmatischer Workflow API-Schlüssel erhalten → REST-API aufrufen Pay-as-you-go oder selbst gehostet

Schnellstart (Cloud):

  1. Besuchen Sie cloud.agenta.ai, um ein Konto zu registrieren (keine Kreditkarte erforderlich).
  2. Erstellen Sie ein Projekt (Anwendung) und wählen Sie einen Modellanbieter (OpenAI, Anthropic usw.) aus.
  3. Schreiben Sie Aufforderungswörter auf dem Spielplatz, fügen Sie Testfälle hinzu, führen Sie die Ergebnisse verschiedener Varianten aus und vergleichen Sie sie.
  4. Bewerten Sie die Ergebnisse systematisch mit vorgefertigten oder benutzerdefinierten Evaluatoren.
  5. Veröffentlichen Sie die zufriedenstellende Version in der Produktionsumgebung und überwachen Sie die Online-Leistung über das Beobachtungspanel.

Selbstgehostete Bereitstellung (Docker Compose): „Bash Git-Klon https://github.com/Agenta-AI/agenta && cd agenta CP-Hosting/Docker-Compose/oss/env.oss.gh.example Hosting/Docker-Compose/oss/.env.oss.gh Docker Compose -f Hosting/Docker-Compose/oss/docker-compose.gh.yml \ --env-file hosting/docker-compose/oss/.env.oss.gh \ --profile with-web --profile with-traefik up -d „ Zugriff über http://localhost nach dem Start. Eine ausführlichere Anleitung zur Remote-Bereitstellung finden Sie in der offiziellen Dokumentation.

Python SDK-Kurzbeispiel: „Python von agenta import EvaluationFlow

Initialisieren Sie den Bewertungsprozess

flow = EvaluationFlow( app_name="mein-chatbot", Variantenname="v1.2", api_key="" )

Führen Sie die Auswertung durch

Ergebnisse = flow.run( testset="produktion_fehler_202607", evaluators=["exact_match", "llm_as_judge"] )

print(results.aggregate_scores()) „

Implementierungstipps: Es wird empfohlen, mit „Pilot → Vergleich → Erweiterung“ vorzugehen. Wählen Sie zunächst 1 bis 2 LLM-Anruflinks mit hoher Wiederholungsrate und geringem Risiko aus (z. B. Erkennung von Kundenabsichten, Generierung von Inhaltszusammenfassungen), richten Sie in Agenta einen vollständigen Prozess für Eingabeaufforderungen + Bewertung + Beobachtung ein, führen Sie ihn 1 bis 2 Wochen lang parallel zum bestehenden Prozess aus und erweitern Sie ihn dann schrittweise auf weitere Szenarien, nachdem bestätigt wurde, dass die Bewertungsindikatoren mit der manuellen Beurteilung übereinstimmen.

Produktpreise

Das Preissystem von Agenta verfügt über eine vierstufige Struktur aus „Hobby Free Verification → Pro Team Collaboration → Business Organizational Governance → Enterprise Corporate Compliance“ und deckt Teams unterschiedlicher Größe mit einer abgestuften Kombination aus Sitzen + Trace-Volumen + Sicherheitsfunktionen ab.

Paket Preis Hauptvorteile Anwendbare Objekte
Hobby $0 2 Plätze, 20 Evaluierungen/Monat, 5.000 Spuren/Monat, 30-Tage-Reservierung Einzelne Entwickler, kleine Teams mit weniger als 2 Personen
Pro 49 $/Monat 3 Plätze (+20 $/zusätzliche Plätze), unbegrenzte Bewertungen, 10.000 Spuren/Monat, 90-tägige Aufbewahrung Kleines Team, früher Start der LLM-Anwendung
Geschäft 399 $/Monat Unbegrenzte Plätze, 1 Mio. Traces/Monat, RBAC, SOC2, SSO, 365 Tage Aufbewahrung Formale Organisation, Compliance-Audit erforderlich
Unternehmen Geschäftsangebot BYOC, Selbsthosting, Prüfprotokolle, individuelles SLA, DPA Finanz-/Medizin-/Regierungsangelegenheiten und andere starke Compliance-Branchen
Selbstgehostet (Open Source) $0 (MIT) Die Software ist kostenlos, Sie müssen Ihre eigene Infrastruktur sowie Betrieb und Wartung bereitstellen Ein Team, das die Datensouveränität in den Vordergrund stellt

Kostenlose Wahrheit: Die Hobby-Lösung ist hinsichtlich der Menge an Trace und der Anzahl der Auswertungen relativ begrenzt und eignet sich eher zur Verifizierung von Kernszenarien als für den Produktionseinsatz. Der kostenlose Plan bietet keine SLA-Garantien und keine erweiterten Sicherheitsfunktionen (RBAC, SSO, SOC2) und die Trace-Aufbewahrungsfrist beträgt nur 30 Tage. Für den ernsthaften Einsatz in Produktionsumgebungen ist der Pro-Plan (49 $/Monat) ein vernünftiger Ausgangspunkt. Die selbst gehostete Version entspricht funktional der Cloud-Version, die Sicherheitsaudit-Bestimmungen der Enterprise-Version (SOC2, HIPAA BAA, Infosec-Auditing) sind jedoch nur im Enterprise-Plan verfügbar.

Kauftipp: Hobby- und Pro-Pläne eignen sich für die vorläufige Überprüfung. Wenn das Team jedoch mehr als 10 Personen umfasst oder RBAC/SSO-Anforderungen bestehen, müssen Sie direkt auf Business oder Enterprise upgraden. Die selbst gehostete Version entspricht funktional der Cloud-Version, die Sicherheitsüberprüfungsfunktion der Enterprise-Version ist jedoch nur im Enterprise-Plan verfügbar. Konkrete Vertragsdetails finden Sie auf der offiziellen Echtzeitseite und in der Geschäftskommunikation.

Anwendungsszenarien

  • Szenario 1: Die Qualität des Kundendienstroboters kehrt zurück - Jede Änderung des Aufforderungsworts des Kundendienstroboters kann sich auf die Genauigkeit und Sicherheit mehrerer Dialogrunden auswirken. Mechanismus: Erstellen Sie einen Testsatz, der häufige Probleme, Grenzfälle und Sicherheitsgrenzen in Agenta abdeckt, und führen Sie die Batch-Auswertungspipeline automatisch aus, jedes Mal, wenn die Eingabeaufforderungswörter geändert werden. Effekt: Aktualisieren Sie „Manuelle Probenahme“ auf „Vollständige Rückgabe“, und der Rückgabezyklus wird von einem halben Tag auf 5 Minuten verkürzt. Verifizierungsmethode: Führen Sie eine Korrelationsanalyse zwischen dem Bewertungswert und dem tatsächlichen Kundenzufriedenheitswert (CSAT) durch, um die Konsistenz zwischen den Bewertungsindikatoren und der tatsächlichen Erfahrung zu überprüfen. Implementierungstipp: Der Testsatz muss weiterhin mit neuen Fehlerfällen aus Produktionsgesprächen ergänzt werden, da sonst die Regressionsabdeckung mit der Zeit abnimmt.

  • Szenario 2: Versionsvergleich von Inhaltsgenerierungsmodellen – Wenn das Team zwischen mehreren Modellen (GPT-4o, Claude Sonnet, DeepSeek-V4 usw.) oder mehreren Versionen wählt, ist eine systematische Vergleichsbasis erforderlich. Mechanismus: Agentas Playground unterstützt die gleichzeitige Ausführung der Ausgabe mehrerer Modelle/Promptwortvarianten desselben Testsatzes in derselben Schnittstelle mit automatischer LLM-as-Judge-Bewertung und manueller Anmerkung. Effekt: Bereitstellung einer quantitativen Grundlage für Modellaktualisierungsentscheidungen, anstatt auf subjektiven Gefühlen oder Lieferantenpropaganda zu basieren. Verifizierungsmethode: Wählen Sie 30–50 Testfälle mit hoher Priorität aus, führen Sie eine manuelle Doppelblindbewertung durch und führen Sie eine Konsistenzanalyse mit LLM-als-Richter-Bewertung durch.

  • Szenario 3: Debuggen und Evaluieren von Agent-Anwendungen – Die Komplexität von Agent-Anwendungen ist viel höher als die einer einzelnen Frage-und-Antwort-Runde – einschließlich Tool-Aufruf, mehrstufiger Schlussfolgerung und Statusverwaltung. Mechanismus: Der Agent Playground von Agenta unterstützt die Anzeige des Argumentationsprozesses und der Tool-Call-Ergebnisse jedes Zwischenschritts und arbeitet mit dem manuellen Genehmigungsmechanismus von HITL zusammen. Auswirkung: Abweichungen bei der Agentenplanung können während der Entwicklungsphase entdeckt werden (z. B. die Auswahl des falschen Tools oder der Argumentationspfad ist zu lang, was dazu führt, dass das Token das Limit überschreitet). Überprüfungsmethode: Für die Agentenbewertung ist ein spezieller Prüfer erforderlich, der überprüft, ob der Toolaufruf korrekt ist und ob der geplante Pfad angemessen ist. Es kann nicht nur die endgültige Ausgabe ausgewertet werden.

  • Szenario 4: Online-Akzeptanz von Multi-Modell-Routing – In der Architektur des „dynamischen Routings zu verschiedenen Modellen basierend auf dem Aufgabentyp“ muss jeder Routing-Zweig unabhängig überprüft werden. Mechanismus: Die benutzerdefinierten Workflows von Agenta unterstützen die Konfiguration unabhängiger Bewerterkombinationen und Akzeptanzschwellenwerte für verschiedene Routingzweige. Auswirkung: Stellen Sie sicher, dass Änderungen in der Routing-Logik nicht zu einer Verschlechterung der Qualität einer Verzweigung führen. Verifizierungsmethode: Der Trace-Link im Routing-Szenario umfasst mehrere LLM-Aufrufe. Es muss bestätigt werden, dass das Beobachtungspanel den End-to-End-Anfragelink vollständig verfolgen kann.

Anwendbare Personen

  • AI Engineering and Platform Team: Es muss ein standardisierter Entwicklungs- und Freigabeprozess für die LLM-Anwendung des Unternehmens eingerichtet werden. Die API/SDK + UI-Zweikanalarchitektur von Agenta ermöglicht es Ingenieuren, Evaluierung und Bereitstellung in die CI/CD-Pipeline einzubetten und dem Produktteam gleichzeitig eine visuelle Experimentieroberfläche zur Verfügung zu stellen. Voraussetzung: Es gibt bereits mehrere LLM-Anwendungslinien, die eine einheitliche Verwaltung benötigen.

  • Prompt-Word-Ingenieur und KI-Produktmanager: Es ist notwendig, Prompt-Wörter systematisch zu iterieren und den Wirkungsunterschied zu quantifizieren. Mit der Playground+-Evaluierungspipeline von Agenta können sie Experimente entwerfen, ausführen und vergleichen, ohne Code schreiben zu müssen. Voraussetzung: Aufforderungswörter müssen häufig angepasst werden, um sie an verschiedene Modellversionen anzupassen.

  • Fachexperten: Obwohl sie keinen Code schreiben, haben sie die Fähigkeit, die richtigen Antworten auf Geschäftsszenarien zu beurteilen. Durch die UI-basierten Auswertungs- und manuellen Anmerkungsfunktionen von Agenta können sie direkt an der Qualitätsabnahme teilnehmen. Voraussetzung: Die Organisation ist bereit, Geschäftswissen direkt in den KI-Qualitäts-Governance-Prozess einzubringen.

  • Ungeeignete Grenze: Wenn das Team nur 1–2 einfache LLM-Aufrufe hat, sind Versionsverwaltung und systematische Auswertung nicht erforderlich; Wenn das Team überhaupt kein Bewertungsbewusstsein und keinen Bewertungsprozess hat, erfordert der standardisierte Prozess von Agenta zusätzliche Kosten für die organisatorische Anpassung. Wenn nur eine grundlegende Eingabeaufforderungsverwaltung erforderlich ist und keine Beobachtung und Agenten-Orchestrierung erforderlich sind, ist möglicherweise ein einfacheres Tool (z. B. PromptHub) besser geeignet. Wenn die Kernanforderung in der Feinabstimmung des Modells und nicht in der Entwicklung prompter Wörter besteht, bietet Agenta keine schulungsbezogenen Funktionen.

Vergleich von Konkurrenzprodukten

Abmessungen vergleichen Agenta LangSmith Eingabeaufforderungen zu Gewichtungen und Voreingenommenheiten Helikon LangFuse
Open Source/Closed Source ✅ Open Source (MIT) ❌ Geschlossene Quelle ❌ Geschlossene Quelle ✅ Open Source (MIT) ✅ Open Source (MIT)
Schnelle Wortverwaltung ✅ Spielplatz + Versionsverwaltung ✅ Spielplatz ✅ Experimentverfolgung ✅ Spielplatz
Systematische Auswertung ✅ Über 20 Bewerter + Anpassung ✅ Evaluierungs-SDK ✅ Bewertungspanel ✅ Evaluierungspipeline
Online-Beobachtung ✅ OpenTelemetry Trace ✅ Spur ✅ Nachverfolgbarkeit + Kosten ✅ Spur
Agenten-Orchestrierung ✅ v0.105+ Agent-Subsystem ✅ LangGraph-Integration
Selbstgehostet ✅ Docker Compose ❌ Nur Cloud ❌ Nur Cloud ✅ Docker ✅ Docker
Preisschwelle $0 (Hobby / Selbstgehostet) Ab 25 $/Monat Unternehmensangebot Ab 20 $/Monat 0 $ (OSS) / Ab 59 $/Monat
Modellbindung Keine (50+ Modelle + Anpassung) LangChain-Ökologie Keine Keine Keine
Unternehmensfunktionen RBAC (OSS)/SSO+SOC2 (kostenpflichtig) RBAC+SSO (kostenpflichtig) RBAC+SSO RBAC (kostenpflichtig) RBAC+SSO (kostenpflichtig)
Ort der Zugehörigkeit Deutschland Vereinigte Staaten Vereinigte Staaten Vereinigte Staaten Deutschland

Entscheidungsvorschlag: Wenn Ihr Team eng mit dem LangChain-Ökosystem verbunden ist, ist die Integrationserfahrung von LangSmith nahtloser; Wenn die Hauptanforderung die Verfolgung von Experimenten und die Verwaltung von Modellschulungen ist, ist W&B Prompts eine ausgereifte Lösung. Wenn Sie nur eine Produktionsumgebung zur Verfolgung und Kostenüberwachung benötigen, ist Helicone leichter; Wenn Sie eine One-Stop-Open-Source-LLMOps-Plattform benötigen und die Selbsthosting-Option beibehalten möchten, ist Agenta derzeit die umfassendste Wahl. Es wird empfohlen, zuerst den kostenlosen Hobby-Plan oder die selbst gehostete Version von Agenta zu verwenden, um einen LLM-Link auszuführen, und dann zu entscheiden, ob er langfristig übernommen werden soll.

Zusammenfassung und Ausblick

Der Kernwert von Agenta besteht darin, die LLM-Anwendungsentwicklung von einem Zustand mit „in Slack und Tabellenkalkulationen verstreuten Eingabeaufforderungen + manueller Sichtprüfung + Glück auf dem Spiel“ zu einem Engineering-Prozess mit „zentral verwalteten Eingabeaufforderungen + systematischer Bewertung + beobachtbarer Produktionsüberwachung“ zu verbessern. Es handelt sich derzeit um eine der wenigen Open-Source-One-Stop-Plattformen, die Prompt-Word-Engineering, Evaluierung, Beobachtung und Agenten-Orchestrierung abdeckt. Die MIT-Lizenz und der Selbsthosting-Pfad von Docker Compose verschaffen ihm einen natürlichen Vorteil in Szenarien zur Einhaltung von Unternehmensdaten.

Hauptvorteile: (1) Open-Source-Volllink-Abdeckung – Vier-in-Eins-Promptwortverwaltung, Bewertung, Beobachtung und Agenten-Orchestrierung; (2) MIT-Lizenz + Selbsthosting, vollständig kontrollierbare Datensouveränität; (3) Modellunabhängiges Design, über 50 Modelle + benutzerdefinierter Anbieter; (4) Hochfrequente Iterationen, aktive Community, 417+ Releases verifizieren die Nachhaltigkeit der Projektwartung.

Aktuelle Einschränkungen: (1) Die Agenten-Orchestrierungsfunktionen befinden sich noch in einer schnellen Iterationsphase und die Überprüfungszeit muss für die Bereitstellung in der Produktionsumgebung reserviert werden. (2) Die Bewertungsstandards für Gutachter (insbesondere LLM als Richter) erfordern, dass das Team Zeit in die Kalibrierung investiert; (3) Die Betriebs- und Wartungskomplexität der selbst gehosteten Version kann nicht ignoriert werden; (4) Die Anzahl der Unternehmenskunden und Umsatzdaten wurden nicht offiziell bekannt gegeben, und die kommerzielle Überprüfung erfordert eine transparentere Informationsoffenlegung.

Beschaffungs-/Einführungsrisikobewertung: Agenta eignet sich für Teams, die LLMOps-Anforderungen identifiziert haben. Verwenden Sie zunächst den kostenlosen Hobby-Plan, um den geschlossenen Kreislauf auf 1 bis 2 hochwertigen LLM-Links zu durchlaufen, um die Gültigkeit der Bewertungsindikatoren und die Teamakzeptanz zu überprüfen, und wählen Sie dann den Pro/Business-Plan oder das Selbsthosting basierend auf dem tatsächlichen Trace-Volumen und den Sitzplatzanforderungen aus. Für Branchen mit extrem hohen Anforderungen an die Datensouveränität (Finanzwesen, medizinische Versorgung, Regierungsangelegenheiten) ist der Selbsthosting-Pfad die grundlegende Wahl, es muss jedoch bewertet werden, ob die internen Betriebs- und Wartungsfunktionen übereinstimmen. Vor dem Kauf müssen Unternehmen Folgendes bestätigen: die Sicherheitsfunktionsabdeckung auf Unternehmensebene der selbst gehosteten Version, die Aufbewahrungs- und Exportstrategie von Trace-Daten, die Produktionsbereitschaft der Agent-Funktionen und die langfristige Wartungsverpflichtung der Open-Source-Community.

Folgebeobachtungsrichtung: Wann werden die Agentenfunktionen in die stabile Version aufgenommen; ob sich die funktionale Lücke zwischen der Open-Source-Version und der Enterprise-Version vergrößern wird; ob im Kontext der kontinuierlichen Weiterentwicklung konkurrierender Produkte wie LangSmith, W&B Prompts, Helicone, LangFuse usw. die Open-Source-Differenzierung von Agenta beibehalten werden kann.

Verwandte Tools: hugging-face, replicate

Versionsinfo

  • Erweiterte Version von Agent Playground :Konzentrieren Sie sich auf die Optimierung der Agent Playground-Sitzungsverwaltung, der Datei-Upload- und Prüffunktionen sowie auf die Verbesserung der Visualisierungsfunktionen des Zwischenstatus während der Ausführung des Agenten. Abhängigkeits-Upgrades und Redis-Stabilitätskorrekturen.
  • Hauptlinie der Big Agents :Die Hauptfunktionen des Agenten wurden zusammengeführt und das Agentenkonfigurationspanel, das Skillsystem, die MCP-Tool-Integration, die Sandbox-Ausführung und der manuelle HITL-Genehmigungsprozess hinzugefügt.
  • Open Source für mehrere Organisationen :Multi-Organisation-Funktionen werden offiziell in OSS aufgenommen und RBAC wird von ee auf die Open-Source-Version migriert.
  • Open-Source-Start :Geben Sie Open-Source-Kernfunktionen frei und unterstützen Sie schnelle Wortexperimente und grundlegende Bewertungen.

Benutzerbewertungen

  • Bewertungen werden geladen...