아젠타
무료
Agenta는
Agenta: 오픈 소스 LLMOps 평가 및 게시 플랫폼
핵심 매개변수 및 통계
Agenta는 LLM 애플리케이션 엔지니어링 팀을 위한 오픈 소스 LLMOps 플랫폼입니다. 공식적으로 "오픈 소스 LLMOps 플랫폼"으로 자리잡은 Agenta는 프롬프트 단어 엔지니어링, 체계적 평가, 온라인 관찰 및 에이전트 오케스트레이션의 네 가지 기능 라인을 단일 제품에 통합합니다. 이는 단순히 "더 나은 프롬프트 편집기"가 아니라 LLM 응용 프로그램 개발을 수동적이고 분산되고 재현 불가능한 프로세스에서 체계적이고 측정 가능하며 추적 가능한 엔지니어링 프로세스로 업그레이드하는 플랫폼 수준 도구입니다.
| 프로젝트 | 사양 |
|---|---|
| 모델/API 이름 | 에이전트 |
| 제품 유형 | 오픈 소스 LLMOps 플랫폼 |
| 배송 형태 | 클라우드 SaaS + 오픈소스 셀프 호스팅(Docker Compose) |
| 컨텍스트 길이 | 연결된 LLM 모델에 따라 다름 |
| 지원 모달 | 텍스트(프롬프트어 엔지니어링 + 평가 + 관찰 + 에이전트 배치) |
| 오픈 소스 라이센스 | MIT 라이센스 |
| GitHub 스타 | ~4,300 |
| GitHub 포크 | 572 |
| 기여자 | 95세 이상 |
| 총 릴리스 | 417+ 릴리스 |
| 최신 버전 | v0.105.3 (2026-07-17) |
| 기술 스택 | 타입스크립트 57.7% + 파이썬 41.2% |
| 지원되는 플랫폼 | 웹, API, 도커 |
| 소속 장소 | 독일(Agentatech UG) |
| 가격 모델 | 무료(자체 호스팅) + 무료 계층(SaaS 취미) / Pro / Business / Enterprise |
핵심 매개변수 해석: Agenta의 "기능"은 단일 모델이 아니라 플랫폼 아키텍처에서 비롯됩니다. 50개 이상의 LLM 모델에 대한 액세스를 지원하는 능력은 팀이 단일 공급업체에 얽매이지 않는다는 것을 의미합니다. 417개의 릴리즈와 95명의 기여자의 커뮤니티 활동은 프로젝트가 초기 실험 단계를 통과하고 안정적인 외부 기여 생태계를 형성했음을 보여줍니다. 지난주에 4가지 버전(v0.105.0~v0.105.3)이 계속 출시되었습니다. 핵심 기능은 집중적으로 반복되었으며, 에이전트 오케스트레이션 및 관찰 패널은 현재 주요 라인입니다.
모델에 구애받지 않는 설계: 맞춤형 제공자 인터페이스를 통해 모든 모델 API에 대한 액세스를 지원하며 팀은 평가 프로세스 중에 다양한 모델의 성능을 자유롭게 전환하고 비교할 수 있습니다. 이는 다중 모델 전략을 사용하는 회사에 특히 중요합니다.
사용자 및 시장 인지도
Agenta의 시장 인지도는 주로 공공 수익이나 고객 수(후자는 공식적으로 공개되지 않음)보다는 오픈 소스 커뮤니티 및 LLM 엔지니어링 팀의 실제 채택에서 비롯됩니다.
오픈 소스 커뮤니티 인기: GitHub에는 현재 약 4,300개의 별과 572개의 포크가 있으며, 417개의 릴리스는 프로젝트가 높은 빈도의 반복 기간에 있음을 나타냅니다. 95명의 기여자에는 핵심 팀과 외부 커뮤니티 기여자가 포함되며, 문제 피드백 및 기능 개선은 특정 외부 검증을 거쳤습니다. 공식 Slack 커뮤니티, GitHub 토론, 공개 로드맵이 제공되며, 커뮤니티 반응이 비교적 활발합니다.
대상 고객 그룹: 공식적으로 "제품 관리자, 개발자 및 도메인 전문가"가 대상 사용자로 나열되어 있으며 이는 설계 목표가 단일 개발자 도구가 아니라 역할 간 LLM 엔지니어링 협업 플랫폼임을 나타냅니다. 제품 포지셔닝 키워드는 '신속 관리'에서 'LLMOps 플랫폼'으로 업그레이드됐다. 이는 프롬프트 단어 관리에서 전체 라이프사이클 관리로 적용 범위가 확대됐음을 반영한다.
구현을 위한 전제 조건: 플랫폼 기반 LLMOps 도구가 진정한 가치를 발휘하려면 팀은 일반적으로 명확한 LLM 애플리케이션 개발 프로세스(프롬프트 단어 반복, 평가 회귀, 온라인 모니터링)를 갖추고 실험, 평가 및 관찰 데이터를 하나의 플랫폼으로 통합하려는 의지가 있어야 합니다. 여전히 "사방에 흩어져 있는 프롬프트 + 수동 육안 검사"를 사용하는 팀의 경우 Agenta의 표준화된 프로세스 자체가 규범적인 구속력을 가져올 것입니다.
업계 경쟁력 있는 포지셔닝: Agenta는 LangSmith(폐쇄 소스, LangChain 생태학적 바인딩), Weights & Biases Prompts(폐쇄 소스, 강력한 실험 추적) 및 Helicone(관찰 관련, 오픈 소스)과 비교하여 LLMOps 도구 생태계에서 "오픈 소스 만능 제품"으로 자리매김했습니다. Agenta는 "오픈 소스 + 프롬프트 단어 관리 + 평가 + 관찰 + 에이전트".
비용 이점
Agenta는 "오픈 소스 호스팅 비용 0 + 무료 클라우드 할당량 항목"이라는 이중 트랙 비용 경로를 제공합니다. 핵심 가치는 LLMOps 플랫폼의 문턱을 '월 수천 달러의 기업 수준 SaaS'에서 '시작 비용 0'으로 낮추는 데 있습니다.
| 비용 계층 구조 | 가격 책정 방법 | 명시적 비용 | 암묵적 비용 |
|---|---|---|---|
| C사이드 / 개인개발자 | 취미(무료) | $0, 시트 2개, 평가 20개/월, 추적 5,000개/월 | 30일 데이터 보존, SLA 없음, 커뮤니티 지원만 가능 |
| 개발자/소규모 팀 | 프로($49/월) | 시트 3개($20/추가 시트), 추적 10,000개/월, 무제한 평가 | Extra Trace $5/10K, 90일 예약 |
| 사업팀 | 비즈니스 ($399/월) | 무제한 시트, 월간 트레이스 100만 개, RBAC, SOC2, SSO | 365일 보존, 비공개 Slack 채널 |
| 기업/민영화 | 기업(비즈니스 견적) | BYOC, 자체 호스팅, 감사 로그, 맞춤형 SLA | 비즈니스 확인 조건 및 DPA 필요 |
| 자체 호스팅(오픈 소스) | 무료(MIT 라이센스) | 소프트웨어 $0, 인프라 비용만 | 운영인력(PostgreSQL + Redis + 멀티컨테이너 오케스트레이션) |
셀프 호스팅의 실제 비용: 자체 호스팅 경로는 라이선스 수준(MIT)에서는 무료이지만 인프라 비용은 기업이 부담합니다. Docker Compose 배포를 예로 들어 보겠습니다. 백엔드는 PostgreSQL + Redis를 사용하며 단일 시스템에서 실행될 수 있습니다. 그러나 동시성이 높은 시나리오에서는 데이터베이스 연결 풀 및 컨테이너 리소스 할당을 고려해야 합니다(최소 4개 코어와 8GB RAM을 갖춘 클라우드 인스턴스 권장). 자체 호스팅은 또한 팀이 버전 업그레이드(월 1~2개 릴리스), 데이터 백업 및 보안 패치 자체를 유지 관리해야 함을 의미합니다. 비즈니스 플랜의 월 399달러와 비교할 때 셀프 호스팅은 규모가 클 때 비용 이점이 있지만 팀이 해당 운영 및 유지 관리 기능을 갖춘 경우에만 가능합니다.
공짜 진실: 클라우드 하비 플랜은 완전 무료이지만, 무료 플랜은 SLA 보장 및 고급 보안 기능(RBAC, SSO, SOC2)을 제공하지 않으며, Trace 보존 기간은 30일에 불과합니다. 프로덕션 환경에서 본격적으로 사용하려면 Pro 요금제(월 49달러)가 합리적인 출발점이 됩니다. 상업용 경쟁사와 비교: LangSmith의 Starter 플랜은 월 25달러부터 시작하지만 기능과 Trace 볼륨이 제한되어 있으며, W&B의 Enterprise 버전은 일반적으로 시트당 월 100달러 이상이고 Agenta의 Pro 플랜은 동종 제품 중에서 다소 낮은 수준입니다.
주요 기능
Agenta의 기능은 "수동, 분산 및 재현 불가능한 프로세스에서 체계적이고 측정 가능하며 추적 가능한 엔지니어링 프로세스로 LLM 애플리케이션 개발을 업그레이드"하는 것을 중심으로 설계되었습니다. 핵심 기능은 다섯 가지 주요 모듈로 요약할 수 있습니다. 각 기능점은 "메커니즘 → 효과 → 장면"의 인과사슬을 따른다.
-
🧪 프롬프트 관리 및 엔지니어링: 메커니즘 - 동일한 인터페이스의 테스트 사례에 대한 여러 모델/프롬프트 단어 변형의 성능을 나란히 비교할 수 있는 대화형 플레이그라운드를 제공합니다. 완전한 버전 기록, 분기 및 환경 관리(스테이징/프로덕션) 지원. 도메인 전문가는 코드를 건드리지 않고도 UI를 통해 프롬프트 단어를 안전하게 편집할 수 있습니다. 효과——프롬프트 단어 반복이 "엔지니어 수동 수정→시각 검사→배포"에서 "UI 편집→자동 평가→원클릭 릴리스"의 폐쇄 루프로 단축됩니다. 시나리오 - AI 제품 관리자는 놀이터에서 세 가지 프롬프트 단어 변형의 동일한 테스트 세트에서 GPT-4o와 Claude의 출력 차이를 비교하고 가장 성능이 좋은 조합을 선택하여 온라인에 게시합니다.
-
📊 체계적인 평가(평가): 메커니즘 - "수동 육안 검사"에서 반복 가능한 평가 프로세스로 업그레이드되었습니다. 프로덕션 데이터, 플레이그라운드 실험 또는 CSV 업로드에서 테스트 세트(테스트 세트) 생성을 지원합니다. 20개 이상의 사전 설정된 평가기(판사로서의 LLM, 정확도 평가, 상관관계 평가, 보안 검사 포함)가 내장되어 있으며 사용자 정의 코드 평가기(Python 기능)도 지원합니다. 평가는 최종 출력뿐만 아니라 에이전트 추론의 모든 중간 단계를 다룰 수 있습니다. 효과 - 평가를 '주관적 판단'에서 '재현 가능한 정량적 지표'로 변경합니다. 프롬프트 단어가 수정될 때마다 품질 지표에 미치는 영향을 즉시 확인할 수 있습니다. 시나리오 - 프롬프트 단어 엔지니어가 고객 서비스 로봇의 시스템 프롬프트를 수정한 후 200개의 테스트 사례가 포함된 일괄 평가 파이프라인이 자동으로 트리거되었습니다. 5분 후 정확도가 87.3%에서 91.1%로 높아졌다는 보고가 접수됐다.
-
📡 온라인 관찰 가능성: 메커니즘 - 오류 노드를 정확하게 찾을 수 있도록 요청 수준 추적을 제공합니다. 각 LLM 통화의 비용, 대기 시간 및 사용 패턴을 추적하세요. OpenTelemetry 기본 프로토콜을 지원하고 OpenLLMetry 및 OpenInference 표준과 호환됩니다. Trace에는 사용자 피드백을 표시할 수 있으며, 비정상적인 Trace를 클릭하면 테스트 케이스로 변환하여 Feedback Closed Loop를 완성할 수 있습니다. 효과 - 온라인에서 LLM 호출 예외가 발생하면 단계별로 로그를 확인할 필요 없이 프롬프트 문제, 모델 문제, 컨텍스트 문제인지 30초 이내에 찾을 수 있습니다. 시나리오 - 운영 및 유지 관리 엔지니어는 관찰 패널에서 API 엔드포인트의 지연이 2초에서 8초로 급증한 것을 발견했습니다. Trace 세부 정보를 보면 컨텍스트가 너무 길어서 토큰 소비가 급증한 것으로 나타났습니다. 한 번의 클릭으로 Trace가 테스트 케이스로 변환되어 회귀 세트에 포함되었습니다.
-
🤖 에이전트 오케스트레이션(에이전트 기능) : 메커니즘 - "하네스 + 스킬 + 도구" 3계층 아키텍처를 사용하는 2026 반복의 초점입니다. Agent Harness는 모델 연결 및 샌드박스 수명 주기를 관리하는 실행 중인 컨테이너입니다. Skill은 재사용 가능한 기능 모듈입니다. 도구는 MCP 또는 내부 게이트웨이를 통해 외부 시스템을 호출하는 특정 실행 단위입니다. 수동확인(HITL) 승인 프로세스 및 도구 호출 권한 제어를 지원합니다. 효과 - Agenta는 '평가 플랫폼'에서 '에이전트 개발 및 운영 및 유지 관리 플랫폼'으로 확장되며, 팀은 동일한 플랫폼에서 Agent의 구축, 평가, 온라인, 모니터링을 완료할 수 있습니다. 시나리오 - 개발자는 Agenta에서 "고객 서비스 에이전트"를 생성하고, Claude Sonnet을 추론 엔진으로 구성하고, CRM 시스템에 도구로 연결하고, HITL 승인을 설정하고(환불 작업에만 수동 확인 필요) 일괄 평가를 실행한 다음 온라인에 게시합니다.
-
👥팀 협업(Collaboration): 메커니즘 - 역할별로 차별화된 인터페이스 제공 - 엔지니어는 API/SDK를 사용하여 프로그래밍 방식의 작업을 수행하고, 제품 관리자 및 도메인 전문가는 UI를 통해 리뷰를 실행하고 프롬프트 단어를 편집합니다. 모든 작업은 도구 전반에 걸쳐 정보 단편화를 줄이기 위해 통합 플랫폼에 중앙 집중화됩니다. 권한 제어는 프로젝트 수준 RBAC를 재정의합니다. 효과 - "제품 관리자가 프롬프트를 변경한 후 수동 배포를 위해 엔지니어에게 보냅니다"라는 협업 마찰을 제거합니다. 모든 변경 사항에는 버전 기록과 승인 링크가 있습니다. 시나리오 - 제품 관리자가 UI에서 고객 서비스 프롬프트를 최적화하고 이를 v2.3으로 저장했습니다. 시스템이 자동으로 평가를 시작하고 엔지니어는 승인 알림을 받았습니다. 확인 후 원클릭으로 프로덕션 환경으로 출시되었습니다.
기능 간 시너지 효과: 이 5개 모듈은 "실험 → 평가 → 관찰 → 피드백 → 최적화"의 폐쇄 루프를 형성합니다. 프로덕션 예외 추적 → 원클릭 테스트 케이스 변환 → 플레이그라운드 수정 프롬프트 → 자동 평가 → 버전 관리 → 배포 및 온라인 → 관찰 패널을 통한 지속적인 모니터링. 이 폐쇄 루프는 LLM 응용 프로그램의 반복 주기를 "일/주"에서 "분/시간"으로 압축합니다.
모델 및 버전의 진화
Agenta의 버전 반복은 의미론적 버전 관리(SemVer)의 리듬과 빈번한 증분 릴리스를 따릅니다. 초기 오픈 소스 코어부터 현재 주요 에이전트 기능 라인까지 네 가지 주요 전환을 다룹니다.
| 버전 | 날짜 | 주요 변경 사항 |
|---|---|---|
| v1(오픈소스 기반) | 2024-01 | 오픈 소스 코어 릴리스, Playground 대화형 비교 및 기본 평가 기능 |
| v0.58.0 | 2025-10 | Enterprise Edition(ee) 디렉토리 구조, 다중 조직 지원, RBAC 기본 프레임워크 |
| v0.84.0 시리즈 | 2025~2026 | 일괄 평가 파이프라인, 회귀 비교 보고서, 관찰 패널 경보 메커니즘 및 추적 세부 정보 |
| v0.103.x 시리즈 | 2026-06 | RBAC가 ee에서 OSS로 이동, UI 최적화(테스트 세트 관리, 평가자 탐색, 일괄 보관) |
| v0.104.0 | 2026-06 | 다중 조직 기능이 OSS, 엔터프라이즈 자체 호스팅 다중 팀 지원에 추가됨 |
| v0.105.0 | 2026-07-14 | 에이전트 기능 메인라인 병합, 새로운 에이전트 패널, 스킬 시스템, MCP 도구, 샌드박스 실행, HITL |
| v0.105.3 | 2026-07-17 | [최신] Agent Playground 세션 관리, 파일 업로드, 인스펙터 기능 강화 |
버전 진화 특성: Agenta의 버전 리듬은 "메인라인은 2주에 한 번, 핫픽스는 일주일에 두 번"이라는 빈도가 높은 패턴을 나타냅니다. 2026년 6월부터 7월까지만 10개 이상의 버전이 출시되었으며, v0.105.x 시리즈는 일주일 이내에 0.105.0에서 0.105.3까지 연속 반복을 완료했습니다. 이러한 리듬은 프로덕션 배포를 고려하는 경우 각 업데이트를 직접 따르기보다는 종결 평가를 위해 검증된 공식 버전을 수정하는 것이 권장된다는 것을 의미합니다.
로드맵 평가: Agenta의 제품 우선순위는 프롬프트 관리(기본) → 평가 시스템(핵심 장벽) → 관찰 패널(차별화) → 에이전트 오케스트레이션(새로운 성장 곡선)이라는 버전 진화를 통해 알 수 있습니다. Agent 기능의 도입은 Agenta의 포지셔닝 업그레이드를 "LLM 평가 도구"에서 "LLM 애플리케이션 전체 라이프사이클 플랫폼"으로 업그레이드했음을 의미합니다. 이는 주목할만한 전략적 방향입니다.
기술적인 장점
Agenta의 기술적 이점은 단일 모델의 성능에서 나오는 것이 아니라 "구조적 개방성 + 풀 링크 폐쇄 루프 + 모델 독립적 설계"라는 3차원의 조합에서 비롯됩니다.
아키텍처 통합 및 역할 적응: Agenta는 여러 개의 독립적인 도구를 결합하는 대신 동일한 API 및 UI를 통해 프롬프트 단어 엔지니어링, 평가, 관찰 및 에이전트 오케스트레이션을 처리합니다. 엔지니어는 Python SDK(pip install Agenta)를 통해 평가 및 배포 프로세스를 CI/CD 파이프라인에 포함시킬 수 있습니다. 제품 관리자와 도메인 전문가는 웹 UI를 통해 매일 실험과 평가를 완료합니다. 완전한 API 및 UI 패리티는 모든 작업을 두 가지 방법으로 완료할 수 있음을 의미합니다. 이는 "UI는 할 수 있지만 API는 할 수 없는 것"의 기능 격차를 방지하는 플랫폼 수준 도구에 대한 주요 아키텍처 결정입니다.
모델 독립적 평가 프레임워크: 평가자(Evaluator) 추상화 계층은 LLM-as-judge(다른 대규모 모델을 사용하여 결과 품질 판단), 내장된 20개 이상의 사전 설정 평가기(정확도, 관련성, 보안 등의 차원을 포괄), 사용자 정의 코드 평가기(Python 함수)의 세 가지 모드를 지원합니다. 평가는 단지 최종 출력을 검사하는 것이 아니라 에이전트 추론의 모든 중간 단계에서 작동할 수 있습니다. SDK의 평가자는 악성 코드 실행을 방지하기 위해 샌드박스 환경(RestrictedPython)에서 실행됩니다.
개방형 기술 스택: 관찰 모듈은 OpenTelemetry 기본 프로토콜을 기반으로 하며 OpenLLMetry 및 OpenInference 표준과 호환됩니다. 이는 이미 OpenTelemetry에 연결된 애플리케이션이 수정 없이 Trace 데이터를 Agenta로 보낼 수 있음을 의미합니다. LangChain, LlamaIndex 등과 같은 널리 사용되는 프레임워크에 대한 기본 통합을 제공합니다. 사용자 정의 공급자 인터페이스를 사용하면 표준 호출 프로토콜이 구현되는 한 모든 모델 API에 액세스할 수 있습니다.
에이전트 기능의 아키텍처 진화: 2026년 v0.105.0에 도입된 에이전트 하위 시스템은 "하네스 + 스킬 + 도구"의 3계층 아키텍처를 채택합니다. Agent Harness는 모델 연결과 샌드박스 수명 주기를 관리하는 실행 중인 컨테이너입니다. 스킬은 에이전트가 수행할 수 있는 작업을 설명하는 재사용 가능한 기능 모듈입니다. 도구는 MCP 또는 내부 게이트웨이를 통해 외부 시스템을 호출하는 특정 실행 단위입니다. HITL 승인 프로세스는 "사람의 지연"을 염두에 두고 설계되었습니다. 승인 시간이 초과된 후 다운그레이드 전략(자동 거부 또는 규칙 기반 자동 승인)이 있습니다.
적응 경계 및 제한 사항
Agenta는 LLMOps 세계에서 완전한 도구 체인을 제공하지만 모든 LLM 개발 시나리오에 전체 기능이 필요한 것은 아닙니다.
권장 사용 시나리오:
- 팀에는 통합 관리가 필요한 여러 LLM 지원 라인이 있습니다.
- 측정 지표가 CI/CD 프로세스에 통합되었거나 통합될 예정입니다.
- 여러 모델 제공자 간의 체계적인 비교 및 버전 관리가 필요합니다.
- 지속적인 모니터링이 필요한 LLM 프로덕션 애플리케이션을 구축하거나 유지 관리합니다.
- 데이터 주권 요구 사항에는 자체 호스팅 LLMOps 플랫폼이 필요합니다.
권장되지 않는 시나리오:
- 팀에는 1~2개의 간단한 LLM 호출(예: 단일 번역 또는 요약 기능)만 있으며 버전 관리 및 체계적인 평가가 필요하지 않습니다.
- 평가에 대한 인식과 프로세스가 전혀 없습니다(즉, "변경하면 그대로 진행하고 문제는 나중에 처리합니다"). Agenta의 표준화된 프로세스에는 추가적인 조직 적응 비용이 필요합니다.
- 기본적인 프롬프트 관리만 필요하며 관찰 및 에이전트 조정은 필요하지 않습니다. 보다 가벼운 도구(예: PromptHub, HumanLoop)가 더 적합할 수 있습니다.
- 핵심 요구 사항은 프롬프트 단어 엔지니어링보다는 모델 미세 조정입니다. - Agenta는 훈련 관련 기능을 제공하지 않으며 미세 조정 플랫폼(예: Weights & Biases)과 함께 사용해야 합니다.
알려진 제한사항:
- 에이전트 오케스트레이션 기능(v0.105.x)은 여전히 빠른 반복 기간에 있으며, HITL 승인 및 MCP 도구 검색의 안정성은 아직 다듬어지고 있으며 프로덕션 환경 배포를 위해 확인 시간을 예약해야 합니다.
- 평가자의 채점 기준(특히 판사로서의 LLM)은 팀이 조정에 시간을 투자하도록 요구합니다. 그렇지 않으면 자동 채점이 인간의 판단에서 벗어날 수 있습니다.
- 자체 호스팅 버전의 운영 및 유지 관리 복잡성은 무시할 수 없습니다. - PostgreSQL, Redis 및 다중 컨테이너 오케스트레이션에는 전문적인 운영 및 유지 관리 인력이 필요합니다.
- 기업 고객 수, 매출 데이터, 구체적인 사용자 등급 등은 공식적으로 공개되지 않았습니다. 상업적 검증에는 보다 투명한 정보 공개가 필요합니다.
- 오픈소스 버전과 기업 버전 간의 기능 격차가 벌어질 위험이 있습니다. SSO, SOC2 등 기업 기능은 기업 버전에서만 사용할 수 있습니다.
사용방법
| 사용 방법 | 군중에게 적합 | 시작하기 | 비용 |
|---|---|---|---|
| 클라우드 SaaS | 신속하게 검증하려는 팀 | cloud.agenta.ai를 방문하여 가입하세요 | 취미 무료/프로 $49/월 |
| 자체 호스팅(Docker Compose) | 데이터 규정 준수 요구 사항이 높은 조직 | git clone → 구성 .env → docker compose up -d | 인프라 비용 |
| 파이썬 SDK | CI/CD 통합이 필요한 엔지니어 | pip 설치 에이전트 | 주문형 API 또는 자체 호스팅 |
| API 액세스 | 프로그래밍 방식의 워크플로 | API 키 획득 → REST API 호출 | 종량제 또는 자체 호스팅 |
빠른 시작(클라우드):
- cloud.agenta.ai를 방문하여 계정을 등록하세요(신용카드 불필요).
- 프로젝트(Application)를 생성하고 모델 제공자(OpenAI, Anthropic 등)를 선택합니다.
- 플레이그라운드에 프롬프트 단어를 작성하고, 테스트 사례를 추가하고, 다양한 변형의 출력을 실행하고 비교합니다.
- 사전 구축된 평가기 또는 사용자 정의 평가기를 사용하여 결과를 체계적으로 평가합니다.
- 만족스러운 버전을 프로덕션 환경에 게시하고 관찰 패널을 통해 온라인 성능을 모니터링합니다.
자체 호스팅 배포(Docker Compose): ``배쉬 git clone https://github.com/Agenta-AI/agenta && cd 에이전트 cp 호스팅/docker-compose/oss/env.oss.gh.example 호스팅/docker-compose/oss/.env.oss.gh docker compose -f 호스팅/docker-compose/oss/docker-compose.gh.yml \ --env 파일 호스팅/docker-compose/oss/.env.oss.gh \ --웹으로 프로필 --traefik으로 프로필 -d
시작 후 http://localhost를 통해 액세스합니다. 자세한 원격 배포 가이드는 공식 문서를 참고하세요.
**Python SDK 빠른 예**:
``파이썬
에이전트 가져오기 평가 흐름에서
#평가 프로세스 초기화
흐름 = 평가흐름(
app_name="my-chatbot",
변형_이름="v1.2",
api_key="<YOUR_API_KEY>"
)
# 평가 실행
결과 = flow.run(
testset="production_errors_202607",
평가자=["exact_match", "llm_as_judge"]
)
인쇄(결과.aggregate_scores())
구현 팁: "Pilot → Comparison → Expansion" 순으로 진행하는 것을 권장합니다. 먼저 반복성이 높고 위험도가 낮은 LLM 통화 링크(예: 고객 의도 인식, 콘텐츠 요약 생성 등)를 1~2개 선택하고 Agenta에서 완전한 프롬프트 단어 + 평가 + 관찰 프로세스를 구축하고 1~2주 동안 기존 프로세스와 병렬로 실행한 후 평가 지표가 수동 판단과 일치하는지 확인한 후 점차 더 많은 시나리오로 확장합니다.
제품 가격
Agenta의 가격 시스템은 "취미 무료 검증 → 프로 팀 협업 → 비즈니스 조직 거버넌스 → 기업 기업 규정 준수"의 4단계 구조를 가지고 있으며 시트 + 추적 볼륨 + 보안 기능의 그라데이션 조합으로 다양한 규모의 팀을 포괄합니다.
| 패키지 | 가격 | 핵심 혜택 | 적용대상 |
|---|---|---|---|
| 취미 | $0 | 시트 2개, 평가 20개/월, 추적 5K/월, 30일 예약 | 개인 개발자, 2명 미만의 소규모 팀 |
| 프로 | $49/월 | 시트 3개(+$20/추가 시트), 무제한 검토, 월별 추적 10,000개, 90일 보존 | 소규모 팀, LLM 지원 조기 출시 |
| 사업 | $399/월 | 무제한 시트, 월간 추적 100만 개, RBAC, SOC2, SSO, 365일 보존 | 공식적인 조직, 규정 준수 감사 필요 |
| 기업 | 사업 견적 | BYOC, 자체 호스팅, 감사 로그, 맞춤형 SLA, DPA | 금융/의료/공무 및 기타 강력한 규정 준수 산업 |
| 자체 호스팅(오픈 소스) | $0(MIT) | 소프트웨어는 무료이므로 자체 인프라와 운영 및 유지 관리를 제공해야 합니다 | 데이터 주권을 최우선으로 생각하는 팀 |
자유로운 진실: Hobby 솔루션은 상대적으로 Trace량과 평가 횟수가 제한되어 있어 프로덕션 용도보다는 핵심 시나리오 검증에 적합합니다. 무료 요금제는 SLA 보장 및 고급 보안 기능(RBAC, SSO, SOC2)을 제공하지 않으며 Trace 보유 기간은 30일에 불과합니다. 프로덕션 환경에서 본격적으로 사용하려면 Pro 요금제(월 49달러)가 합리적인 출발점이 됩니다. 자체 호스팅 버전은 기능적으로 클라우드 버전과 동일하지만 Enterprise 버전의 보안 감사 조항(SOC2, HIPAA BAA, Infosec 감사)은 Enterprise 플랜에서만 사용할 수 있습니다.
구매 팁: Hobby 및 Pro 요금제는 사전 검증에 적합하지만 팀이 10명을 초과하거나 RBAC/SSO 요구 사항이 있는 경우 Business 또는 Enterprise로 직접 업그레이드해야 합니다. 자체 호스팅 버전은 기능적으로 클라우드 버전과 동일하지만 Enterprise 버전의 보안 감사 제공은 Enterprise 요금제에서만 사용할 수 있습니다. 구체적인 계약 내용은 공식 실시간 페이지 및 비즈니스 커뮤니케이션을 참고하시기 바랍니다.
애플리케이션 시나리오
-
시나리오 1: 고객 서비스 로봇의 반품 품질 - 고객 서비스 로봇의 프롬프트 단어를 수정할 때마다 여러 라운드의 대화의 정확성과 안전성에 영향을 미칠 수 있습니다. 메커니즘: Agenta의 일반적인 문제, 극단적인 사례 및 보안 경계를 다루는 테스트 세트를 생성하고 프롬프트 단어가 수정될 때마다 일괄 평가 파이프라인을 자동으로 실행합니다. 효과: "수동 샘플링"을 "전체 반환"으로 업그레이드하면 반환 주기가 반나절에서 5분으로 단축됩니다. 검증방법: 평가점수와 실제 고객만족도(CSAT) 간의 상관관계 분석을 실시하여 평가지표와 실제 경험 간의 일관성을 검증합니다. 구현 팁: 테스트 세트는 프로덕션 대화의 새로운 실패 사례로 계속 보완되어야 합니다. 그렇지 않으면 회귀 적용 범위는 시간이 지남에 따라 감소합니다.
-
시나리오 2: 콘텐츠 생성 모델의 버전 비교 - 팀이 여러 모델(GPT-4o, Claude Sonnet, DeepSeek-V4 등) 또는 여러 버전 중에서 선택할 때 체계적인 비교 기반이 필요합니다. 메커니즘: Agenta의 Playground는 LLM이 심판관으로 자동 채점 및 수동 주석을 사용하여 동일한 인터페이스에서 동일한 테스트 세트의 여러 모델/프롬프트 단어 변형 출력을 나란히 실행할 수 있도록 지원합니다. 효과: 주관적인 감정이나 공급업체 선전에 기반하기보다는 모델 업그레이드 결정에 정량적 기반을 제공합니다. 검증 방법: 우선순위가 높은 테스트 사례 30~50개를 선택하고 수동 이중 맹검 채점을 수행하며 LLM-as-judge 채점을 통해 일관성 분석을 수행합니다.
-
시나리오 3: 에이전트 애플리케이션 디버깅 및 평가 - 에이전트 애플리케이션의 복잡성은 도구 호출, 다단계 추론 및 상태 관리와 관련된 단일 질문 및 답변 라운드보다 훨씬 더 복잡합니다. 메커니즘: Agenta의 Agent Playground는 각 중간 단계의 추론 프로세스 및 도구 호출 결과 보기를 지원하고 HITL 수동 승인 메커니즘과 협력합니다. 효과: 개발 단계에서 에이전트 계획 편차가 발견될 수 있습니다(예: 잘못된 도구 선택, 추론 경로가 너무 길어 토큰이 한도를 초과함). 검증 방법: 에이전트 평가에는 도구 호출이 올바른지, 계획된 경로가 합리적인지 확인하기 위해 특별한 평가자가 필요합니다. 최종 출력만 평가할 수는 없습니다.
-
시나리오 4: 다중 모델 라우팅의 온라인 수용 - "작업 유형에 따라 다른 모델로의 동적 라우팅" 아키텍처에서는 각 라우팅 분기를 독립적으로 검증해야 합니다. 메커니즘: Agenta의 사용자 정의 워크플로는 다양한 라우팅 분기에 대한 독립적인 평가자 조합 및 허용 임계값 구성을 지원합니다. 효과: 라우팅 로직의 변경으로 인해 지점 품질이 저하되지 않도록 합니다. 확인 방법: 라우팅 시나리오의 추적 링크에는 여러 LLM 호출이 포함됩니다. 관찰 패널이 엔드 투 엔드 요청 링크를 완벽하게 추적할 수 있는지 확인해야 합니다.
해당자
-
AI 엔지니어링 및 플랫폼팀: 회사의 LLM 애플리케이션을 위한 표준화된 개발 및 출시 프로세스를 확립해야 합니다. Agenta의 API/SDK + UI 이중 채널 아키텍처를 통해 엔지니어는 평가 및 배포를 CI/CD 파이프라인에 포함시키는 동시에 제품 팀에 시각적 실험 인터페이스를 제공할 수 있습니다. 전제 조건: 통합 관리가 필요한 LLM 지원 라인이 이미 여러 개 있습니다.
-
프롬프트어 엔지니어 및 AI 제품 관리자: 프롬프트어를 체계적으로 반복하고 효과 차이를 정량화하는 것이 필요합니다. Agenta의 Playground + 평가 파이프라인을 사용하면 코드를 작성하지 않고도 실험을 설계, 실행 및 비교할 수 있습니다. 전제 조건: 다양한 모델 버전에 맞게 프롬프트 단어를 자주 조정해야 합니다.
-
주제 전문가: 코드를 작성하지 않더라도 비즈니스 시나리오에 대한 정답을 판단할 수 있는 능력을 갖추고 있습니다. Agenta의 UI 기반 평가 및 수동 주석 기능을 통해 품질 승인에 직접 참여할 수 있습니다. 전제조건: 조직은 비즈니스 지식을 AI 품질 거버넌스 프로세스에 직접 주입할 의향이 있습니다.
-
부적합한 경계: 팀에 1~2개의 단순 LLM 호출만 있는 경우 버전 관리 및 체계적인 평가가 필요하지 않습니다. 팀에 평가 인식 및 프로세스가 전혀 없는 경우 Agenta의 표준화된 프로세스에는 추가적인 조직 적응 비용이 필요합니다. 기본적인 프롬프트 관리만 필요하고 관찰 및 에이전트 조정이 필요하지 않은 경우에는 PromptHub와 같은 더 가벼운 도구가 더 적합할 수 있습니다. 핵심 요구 사항이 프롬프트 단어 엔지니어링이 아닌 모델 미세 조정인 경우 Agenta는 교육 관련 기능을 제공하지 않습니다.
경쟁제품 비교
| 차원 비교 | 에이전트 | 랭스미스 | 가중치 및 편향 프롬프트 | 헬리콥터 | 랭퓨즈 |
|---|---|---|---|---|---|
| 오픈소스/비공개소스 | ✅ 오픈 소스(MIT) | ❌ 비공개 소스 | ❌ 비공개 소스 | ✅ 오픈 소스(MIT) | ✅ 오픈 소스(MIT) |
| 신속한 단어관리 | ✅ 플레이그라운드 + 버전 관리 | ✅ 놀이터 | ✅ 실험 추적 | ❌ | ✅ 놀이터 |
| 체계적인 평가 | ✅ 20명 이상의 평가자 + 사용자 정의 | ✅ 평가 SDK | ✅ 평가 패널 | ❌ | ✅ 평가 파이프라인 |
| 온라인 참관 | ✅ OpenTelemetry 추적 | ✅ 추적 | ❌ | ✅ 추적 + 비용 | ✅ 추적 |
| 에이전트 오케스트레이션 | ✅ v0.105+ 에이전트 하위 시스템 | ✅ LangGraph 통합 | ❌ | ❌ | ❌ |
| 자체 호스팅 | ✅ 도커 작성 | ❌ 클라우드 전용 | ❌ 클라우드 전용 | ✅ 도커 | ✅ 도커 |
| 가격 책정 기준 | $0 (취미/자체 호스팅) | 월 $25부터 시작 | 기업용 제안 | 월 $20부터 시작 | $0(OSS) / 월 $59부터 |
| 모델 바인딩 | 없음(50개 이상의 모델 + 사용자 정의) | LangChain 생태학 | 없음 | 없음 | 없음 |
| 엔터프라이즈 기능 | RBAC(OSS)/SSO+SOC2(유료) | RBAC+SSO(유료) | RBAC+SSO | RBAC(유료) | RBAC+SSO(유료) |
| 소속 장소 | 독일 | 미국 | 미국 | 미국 | 독일 |
결정 제안: 귀하의 팀이 LangChain 생태계에 깊이 묶여 있다면 LangSmith의 통합 경험이 더욱 원활해집니다. 주요 요구 사항이 실험 추적 및 모델 교육 관리라면 W&B Prompts가 성숙한 솔루션입니다. 생산 환경 추적 및 비용 모니터링만 필요한 경우 Helicone이 더 가볍습니다. 원스톱 오픈 소스 LLMOps 플랫폼이 필요하고 자체 호스팅 옵션을 유지하려는 경우 현재 Agenta가 가장 포괄적인 선택입니다. LLM 링크를 먼저 실행하려면 Agenta의 Hobby 무료 요금제 또는 자체 호스팅 버전을 사용하고 장기적으로 채택할지 여부를 결정하는 것이 좋습니다.
요약 및 전망
Agenta의 핵심 가치는 LLM 애플리케이션 개발을 "Slack 및 스프레드시트에 흩어져 있는 프롬프트 단어 + 수동 육안 검사 + 현장 행운" 상태에서 "중앙 관리형 프롬프트 단어 + 체계적인 평가 + 관찰 가능한 생산 모니터링"의 엔지니어링 프로세스로 업그레이드하는 것입니다. 현재 프롬프트 워드 엔지니어링, 평가, 관찰 및 에이전트 오케스트레이션을 다루는 몇 안 되는 오픈 소스 원스톱 플랫폼 중 하나입니다. MIT 라이선스와 Docker Compose 자체 호스팅 경로는 기업 데이터 규정 준수 시나리오에서 자연스러운 이점을 제공합니다.
핵심 장점: (1) 오픈 소스 전체 링크 적용 범위 - 프롬프트 단어 관리, 평가, 관찰 및 에이전트 오케스트레이션이 4가지 기능으로 하나로 통합되어 있습니다. (2) MIT 라이센스 + 자체 호스팅, 완전히 제어 가능한 데이터 주권; (3) 모델 독립적인 디자인, 50개 이상의 모델 + 맞춤형 제공자; (4) 높은 빈도의 반복, 활발한 커뮤니티, 417+ 릴리스는 프로젝트 유지 관리의 지속 가능성을 확인합니다.
현재 제한사항: (1) 에이전트 오케스트레이션 기능은 여전히 빠른 반복 기간에 있으며 프로덕션 환경 배포를 위해 확인 시간을 예약해야 합니다. (2) 평가자 채점 표준(특히 판사로서의 LLM)은 팀이 교정에 시간을 투자하도록 요구합니다. (3) 자체 호스팅 버전의 운영 및 유지 관리 복잡성은 무시할 수 없습니다. (4) 기업 고객 수와 매출 데이터가 공식적으로 공개되지 않았으며, 상업적 검증은 보다 투명한 정보 공개가 필요합니다.
조달/채택 위험 평가: Agenta는 LLMOps 요구 사항을 파악한 팀에 적합합니다. 먼저 Hobby free 플랜을 사용하여 1~2개의 고가치 LLM 링크에서 폐쇄 루프를 실행하여 평가 지표의 타당성과 팀 수용 여부를 확인한 다음 실제 추적량 및 좌석 요구 사항을 기반으로 Pro/Business 플랜 또는 자체 호스팅을 선택합니다. 데이터 주권 요구 사항이 매우 높은 산업(금융, 의료, 공무)의 경우 자체 호스팅 경로가 기본 선택이지만 내부 운영 및 유지 관리 기능이 일치하는지 평가할 필요가 있습니다. 구매하기 전에 기업은 자체 호스팅 버전의 엔터프라이즈 수준 보안 기능 적용 범위, Trace 데이터의 보존 및 내보내기 전략, 에이전트 기능의 생산 준비 상태, 오픈 소스 커뮤니티의 장기 유지 관리 약속을 확인해야 합니다.
후속 관찰 방향: 에이전트 기능은 언제 안정 버전으로 전환되나요? 오픈소스 버전과 엔터프라이즈 버전 간의 기능적 격차가 넓어질지 여부 LangSmith, W&B Prompts, Helicone, LangFuse 등 경쟁 제품의 지속적인 진화 속에서 Agenta의 오픈소스 차별화가 유지될 수 있는지 여부.
관련 도구: hugging-face, replicate
버전 정보
- Agent Playground 향상된 버전 :Agent Playground 세션 관리, 파일 업로드 및 검사기 기능을 최적화하고 Agent 실행 중 중간 상태의 시각화 기능을 향상시키는 데 중점을 둡니다. 종속성 업그레이드 및 Redis 안정성 수정.
- 빅 에이전트 메인 라인 :에이전트 기능의 주요 라인이 병합되었으며 에이전트 구성 패널, 스킬 시스템, MCP 도구 통합, 샌드박스 실행 및 HITL 수동 승인 프로세스가 추가되었습니다.
- 다중 조직 오픈 소스 :다중 조직 기능은 공식적으로 OSS에 포함되고 RBAC는 ee에서 오픈 소스 버전으로 마이그레이션됩니다.
- 오픈소스 출시 :오픈소스 핵심 기능을 출시하고 신속한 단어 실험과 기본 평가를 지원합니다.
사용자 후기