갈릴레오 무료

-

Galileo는 시나리오를 위한 GenAI 평가 AI 관찰 가능성 및 프로덕션 가드레일 플랫폼으로, 오프라인 실험 RAG/에이전트 표시기, 온라인 추적, 지연 시간이 짧은 Luna-2 평가 모델 및 엔터프라이즈 수준 배포를 포괄합니다.

갈릴레오 제품 인터페이스

갈릴레오

핵심 매개변수 및 통계

Galileo는 AI 신뢰성 플랫폼으로 자리매김하고 있으며 핵심 제공은 "오프라인 평가를 생산 가드레일로 전환"하는 통합 워크플로우입니다. 이 제품은 AI 평가, AI 관찰 가능성, 실시간 보호라는 세 가지 주요 모듈을 다룹니다. SDK, API, 웹 콘솔을 통해 접속하며, SaaS, VPC, 온프레미스의 3가지 배포 방식을 지원합니다.

프로젝트 공공정보
제품 포지셔닝 GenAI 및 Agentic 애플리케이션을 위한 평가, 관찰 가능성 및 생산 가드레일 플랫폼
핵심 개체 추적, 세션, 범위, 데이터 세트, 프롬프트, 지표, 가드레일
사전 설정된 표시기 RAG, 에이전트, 안전, 보안 및 기타 범주를 다루는 20개 이상의 기본 평가
접근방법 웹 콘솔 Python SDK, TypeScript SDK, REST API, 주류 에이전트 프레임워크 통합
워크플로우 범위 오프라인 실험(Evaluate), 온라인 관찰(Observe), 실시간 가드레일(Protect)
배포 양식 SaaS, 가상 사설 클라우드, 온프레미스
Luna-2 평가모델 $0.12/1M 토큰, 0.95 정확도, 152ms 평균 대기 시간, 128k 컨텍스트
최신 공개 업데이트 2026-06-05 기업 고객을 위한 에이전트 제어
가격 계획 무료 / Pro($100/월) / Enterprise(문의) 3개 계층

경계 참고: Galileo는 일반 챗봇이나 순수한 로깅 플랫폼이 아닙니다. 이미 GenAI, RAG 또는 에이전트 애플리케이션을 보유하고 있으며 실제 정보 구축, 지표 보정 및 가드레일 전략 정의에 시간을 투자할 의지가 있는 팀이 필요합니다. 팀이 아직 AI 애플리케이션 개발에 착수하지 않았거나 평가 방법론이 부족한 경우 플랫폼의 초기 온보딩 비용은 도구 자체의 가격보다 높을 것입니다.

사용자 및 시장 인지도

Galileo의 시장 신호는 C 포트 평판이나 GitHub 스타보다는 기업 수준의 고객 채택과 자본 인식이라는 두 가지 차원에 중점을 둡니다.

파이낸싱 및 기업 성장: 2024년 10월, 총 6,800만 달러의 자금 조달로 4,500만 달러 규모의 시리즈 B를 완료했다고 공식 발표했습니다. 같은 발표에서는 2024년 이후 매출이 834% 증가했고, 기업 고객 수가 4배 증가했으며, Fortune 50대 기업 6개가 소개되었다고 밝혔습니다. 투자자는 공개 페이지에 공개되지 않았지만 자금 조달 규모는 AI 평가 트랙에서 최고 수준입니다.

고객 및 에코 파트너: Twilio, Comcast, HP, Writer, Cisco Outshift, Ema, NVIDIA, Satisfi Labs, MongoDB, CrewAI, Clearwater Analytics 등과 같은 고객 또는 파트너 리뷰가 제품 페이지 및 가격 페이지에 표시됩니다. 평가는 "Luna-2 생산 평가 및 RAG 품질 관리를 관찰하기 위해 Galileo를 에이전트로 사용"에 중점을 두어 엔터프라이즈 수준의 AI 거버넌스 시나리오에 중점을 두고 있음을 나타냅니다.

개발자 커뮤니티: GitHub 조직 'rungalileo'에는 팔로어 184명과 저장소 58개가 있습니다. 주요 오픈 소스 프로젝트에는 'agent-leaderboard'(별 224개, LLM 에이전트 기능 순위를 지정하는 데 사용됨), 환각 지수'(별 116개, LLM 환각 경향 평가), 'galileo-python' SDK(별 22개, Apache-2.0 라이선스)가 포함됩니다. 오픈 소스 웨어하우스는 데모 및 통합 예시에 가깝고, 제품의 핵심 기능은 폐쇄 소스 SaaS 계층에 있습니다.

비용 이점

Galileo의 비용 구조는 기존 LLM 모니터링 도구와 근본적으로 다릅니다. GPT-5.4 또는 Claude를 매번 판단하는 데 의존하지 않고 Luna-2 전용 평가 모델을 사용하여 고주파 평가 비용을 일반 솔루션의 3%-5%로 줄입니다.

C 클라이언트/개인: 월별 무료 플랜 $0, 월별 추적 5,000개, 무제한 사용자, 무제한 사용자 정의 평가가 포함됩니다. 개별 개발자가 소규모 개념 증명을 수행하는 데 적합합니다. 제한 사항은 무료 할당량이 프로덕션 요구 사항보다 훨씬 낮고(고빈도 에이전트 시스템은 하루에 수만 개의 추적을 생성할 수 있음) SSO, RBAC 및 전용 지원이 부족하다는 것입니다.

개발자/API: Pro 플랜은 월 $100부터 시작하며(연간 주석 33% 할인) 월 50,000개 트레이스, 표준 RBAC, 고급 분석 및 Slack 지원을 포함합니다. 가격 책정 페이지에는 추적 수에 따라 가격이 선형적으로 확장된다고 나와 있습니다. 개발팀의 실제 비용에는 구독료뿐만 아니라 LLM이 Luna 지표를 호출하는 판사로서의 오버헤드, 데이터 보존 및 실험 저장 비용도 포함됩니다.

엔터프라이즈/프라이빗: 엔터프라이즈는 문의하기이며 무제한 추적, 사용자 지정 속도 제한, 호스팅/VPC/온프레미스 배포 옵션, 엔터프라이즈급 RBAC/SSO, 전용 CSM, 실시간 가드레일 연중무휴 지원, 지연 시간이 짧은 전용 추론 서버 및 전방 배포 엔지니어링 지원을 포함합니다. Luna-2의 $0.12/1M 토큰은 GPT-5.4의 $5.00/1M 토큰에 비해 평가 비용을 약 97% 절약할 수 있습니다. 그러나 Luna 메트릭은 기업 계약에 따라 공개되며 기본적으로 모든 사용자가 사용할 수 있는 것은 아닙니다.

숨겨진 비용: AI 측정의 실제 비용은 Galileo 구독뿐만 아니라 측정 지표 구축 및 보정, 데이터 보존 및 대역폭, 전용 추론 서버의 운영 및 유지 관리, 측정 프로세스를 배우고 개발하는 팀 시간에 투자된 판사로서의 LLM 호출 비용도 포함됩니다. Luna-2는 고주파 평가의 한계 비용을 줄이지만 실측 구축 및 지표 최적화에 대한 초기 엔지니어링 투자는 무시할 수 없습니다.

주요 기능

갈릴레오의 기능은 모듈별로 독립적으로 쌓이는 것이 아니라 '데이터 수집 → 평가 및 구축 → 고장 분석 → 가드레일 발사'의 4단계로 구성된다.

  • 데이터 및 주석 자산 관리: 합성 데이터, 개발 컨텍스트 및 생산 트래픽으로 데이터 세트를 구성하고 도메인 전문가의 주석을 지원하여 지속적으로 업데이트되는 실측 자산을 형성합니다. 주요 수용 포인트는 주석 워크플로우가 기존 데이터 파이프라인과 연결될 수 있는지 여부와 Groundtruth의 버전 관리 및 롤백 메커니즘입니다.
  • 20개 이상의 사전 설정된 평가 지표 + 사용자 정의 평가: RAG 평가(검색 품질, 컨텍스트 정밀도), 에이전트 평가(도구 선택, 작업 발전, 작업 완료), 안전 평가(편향, 독성), 보안 평가(즉시 삽입, PII 유출)를 다룹니다. 사용자 정의 검토는 코드 기반 또는 LLM-as-judge 자동 생성을 지원합니다. 주요 수용점은 미리 설정된 지표가 비즈니스 도메인과 일치하는지, 맞춤형 지표의 정확도(F1)가 80% 이상에 도달할 수 있는지 여부입니다.
  • 그래프 엔진 에이전트 관찰: 에이전트의 분기, 도구 호출, 결정 경로 및 세션 컨텍스트를 선형 로그에서 그래프 경로로 확장하여 다중 에이전트 시스템 A2A 프로토콜 및 분산 추적을 지원합니다. 핵심 수용 포인트는 실패한 범위를 신속하게 찾고 2~3번의 클릭 이내에 전체 속성 링크를 볼 수 있다는 것입니다.
  • Insights 엔진 자동 오류 분석: 에이전트 행동 데이터를 분석하고 오류 패턴, 숨겨진 패턴 및 근본 원인을 식별하고 실행 가능한 제안을 제공합니다(예: "도구 입력에 몇 가지 예시 추가"). 주요 수용 포인트는 권장 사항의 정확성과 거짓 긍정 비율, 그리고 엔지니어링 팀이 권장 사항을 채택하는 비율입니다.
  • Luna-2 프로덕션 수준 평가: 3B/8B 매개변수가 있는 SLM을 사용하여 일반 LLM-판단을 대체하여 200ms 미만의 대기 시간, 128k 컨텍스트 및 $0.12/1M 토큰으로 저비용 평가를 달성합니다. 주요 승인 포인트는 Luna 측정항목과 사람 주석의 일관성, 높은 QPS에서의 대기 시간 안정성입니다.
  • 에이전트 제어 중앙 가드레일 관리: 중앙 제어 플레인을 사용하여 가드레일 정책을 정의하여 에이전트 코드 변경 없이 유해 콘텐츠 프롬프트 삽입, PII 유출, 교차 사용자 작업 등의 위험을 차단합니다. 주요 승인 지점은 잘못된 차단율, 감사 로그 무결성 및 수동 대체 경로입니다.
  • 자동 조정 및 지속적인 학습: CLHF(Continuous Lear)를 통해

ning with Human Feedback) 메커니즘은 몇 번의 예시를 사용하여 자동으로 평가 프롬프트를 최적화하고 지표 정확도를 점진적으로 향상시킵니다. 주요 승인 포인트는 자동 조정의 유효 기간과 빈번한 수동 개입이 필요한지 여부입니다.

모델 및 버전의 진화

Galileo는 계속해서 반복되는 SaaS 플랫폼입니다. 버전 기록은 공식 공개 마일스톤에 따라 4단계로 나눌 수 있습니다.

메인 라인 이정표

  • 2024-10-15: 평가지능 플랫폼. 시리즈 B 발표는 주요 제품 라인을 정밀 조정(Fine-Tune), 평가(Evaluate), 관찰(Observe), 보호(Protect)의 4단계를 포괄하는 평가 인텔리전스(Evaluation Intelligence)로 재정의하고 오프라인 실험에서 생산 관리까지의 전체 연결을 강조합니다. 이는 Galileo가 초기 NLP 도구에서 GenAI 평가 플랫폼으로 전환하는 핵심 전환입니다.
  • 2025-07-16: 에이전트 신뢰성 플랫폼. 에이전트 신뢰성 플랫폼을 무료로 출시하고, 그래프 엔진(에이전트 경로 관찰), 인사이트 엔진(자동 장애 분석), Luna-2(낮은 지연 시간 평가 모델)를 도입하고, 제품 초점을 "RAG 평가"에서 "에이전트 전체 수명주기 신뢰성"으로 확장합니다.
  • 2026-05-22: Luna Studio 및 통합 비용. 릴리스 노트에서는 기업이 지연 시간이 짧은 맞춤형 SLM 지표를 교육할 수 있는 Luna Studio 엔터프라이즈 기능을 출시합니다. 또한 통합 비용 비용 관리 페이지를 추가하여 팀이 판사로서의 LLM, Luna 및 유지 지출 구조를 시각적으로 추적할 수 있습니다.
  • 2026-06-05: 에이전트 제어. 릴리스 노트에서는 중앙 제어 플레인을 사용하여 가드레일과 거버넌스 정책을 관리하고 코드 변경 없이 신속한 주입, PII 유출, 교차 사용자 작업과 같은 위험을 차단하는 엔터프라이즈 에이전트 제어를 출시합니다. 갈릴레오의 '관찰+평가'에서 '거버넌스+차단'으로의 제품 확장이다.

검증 핵심사항

2026-06-05 Agent Control은 최신 공개 기능 노드이지만 실제 가용성은 엔터프라이즈 패키지, 배포 양식 및 판매 활성화에 영향을 받습니다. Luna 지표는 Luna-2 페이지에 "요청 시 고객에게만 공개"로 표시되어 있으며 모든 사전 설정된 지표는 기본적으로 즉시 사용할 수 있는 것으로 간주될 수 없습니다. 구매 시 기업은 현재 계약 범위 내에서 Luna Studio 및 Agent Control의 구체적인 활성화 조건을 확인해야 합니다.

기술적인 장점

Galileo의 기술적 이점은 단일 포인트 모델이나 단일 지표가 아닌 평가 모델, 관측 데이터 및 생산 가드레일의 3계층 통합에서 비롯됩니다.

평가 모델 계층(Luna-2): Luna-2는 결정론적 평가 출력을 위해 경량 메트릭 헤드가 있는 디코더 전용 SLM을 사용합니다. 기계적으로는 3B/8B 베이스의 미세 조정 및 어댑터를 통해 다양한 평가 치수에 적응합니다. 실제로 $0.12/1M 토큰은 0.95의 정확도를 유지하면서 GPT-5.4의 $5.00/1M 토큰에 비해 각 평가 비용을 약 97% 절감합니다. 적용 가능한 시나리오는 고객 서비스 상담원, RAG Q&A 및 재무 규정 준수 확인과 같은 빈도가 높은 다중 인덱스 병렬 생산 컨텍스트 평가입니다. Luna-2의 128k 컨텍스트 창은 긴 대화 시나리오의 엔드투엔드 평가를 지원하는 반면 비슷한 가격의 경쟁업체(예: Azure Content Safety)의 3k 창은 컨텍스트를 잃습니다.

관찰 계층(그래프 엔진): 그래프 엔진은 선형 로그의 에이전트 호출을 방향성 그래프로 변환합니다. 각 노드는 도구 호출 또는 LLM 요청이고 가장자리는 정보 흐름 및 제어 전송입니다. 기계적으로 OpenTelemetry 확장 및 SDK 뷰로를 통해 범위 및 추적을 캡처한 다음 백엔드에서 경로 토폴로지를 재구성합니다. 실제로 엔지니어링 팀은 한 번의 관찰로 에이전트의 모든 분기, 재시도 및 오류 경로를 볼 수 있습니다. 적용 가능한 시나리오는 다중 에이전트 협업, A2A 프로토콜 MCP 서버 호출 등과 같은 복잡한 오케스트레이션 시나리오입니다.

가드레일 계층(에이전트 제어): 에이전트 제어는 평가 점수를 실행 제어 작업에 직접 매핑합니다. 기계적으로 가드레일은 도구가 호출되기 전에 미리 정의된 정책에 따라 실행이 허용되는지 여부를 결정합니다. 실제로 팀은 에이전트 코드를 수정하지 않고도 유해한 작업을 차단할 수 있습니다. 적용 가능한 시나리오는 PII 유출 방지 프롬프트 주입 차단, 사용자 간 작업 차단, 경제적 손실 위험 제어(예: 단일 전송 상한)입니다.

엔지니어링 관찰 가능성 기본: Galileo의 Insights 엔진은 단순한 로그 집계가 아니지만 수백만 개의 신호(모델 프롬프트, 기능, 컨텍스트 데이터 세트, 추적, MCP 서버)에 대한 패턴 인식을 수행합니다. 제품 페이지에는 사례가 표시됩니다. Galileo는 "잘못된 도구 입력을 유발하는 환각"을 자동으로 감지하고 "올바른 도구 입력을 보여주기 위해 몇 가지 예시를 추가"하라는 제안을 제공합니다. 이는 근본 원인 분석 기능이 통계 요약에서 규칙 생성으로 업그레이드되었음을 나타냅니다.

사용방법

Galileo의 진입은 웹 콘솔 SDK/API와 엔터프라이즈 배포의 세 가지 범주로 나뉩니다. 개발자는 무료로 등록하여 시작할 수 있지만 기업 팀에서는 먼저 데이터 경계와 규정 준수 요구 사항을 명확히 해야 하는 경우가 많습니다.

사용 방법 모두에게 적합 주요활동 주의사항
웹 콘솔 제품 및 운영 AI 품질 관리자 추적/세션/메트릭 보기, 실험 실행, 가드레일 구성 먼저 애플리케이션 로그에 액세스하거나 평가 데이터를 가져와야 함
Python SDK(갈릴레오-파이썬) 엔지니어링팀 ML 엔지니어 pip install galileo → GalileoLogger 초기화 → 추적 및 실험 기록 API Key, 프로젝트 Key, 로그 필드, 샘플링 전략 관리 필요
TypeScript SDK(galileo-js) 에이전트 개발자, 풀스택 엔지니어 npm install @rungalileo/galileo-js → 클라이언트 초기화 → 에이전트 프레임워크에 연결 프레임워크(LangGraph, CrewAI 등)와 협력해야 하는 미들웨어 또는 콜백
REST API 다국어 컨텍스트, 맞춤형 통합 /v1/traces, /v1/experiments, /v1/guardrails 및 기타 엔드포인트 호출 인증, 전류 제한, 오류 재시도를 직접 처리해야 함
엔터프라이즈 배포 보안, 규정 준수 및 플랫폼 팀 호스팅/VPC/온프레미스 시나리오 평가 비즈니스 확인 계약, 데이터 상주 SLA 및 전용 추론 필요

일반적인 시작 경로: 공식 웹사이트에서 무료 등록 → 프로젝트 생성 → SDK 설치 및 첫 번째 추적 기록 → 추적에 대해 미리 설정된 평가 지표 실행 → Insights에서 실패 모드 보기 → 안정적인 지표를 실험 및 가드레일로 확장합니다. RAG 시스템의 경우 검색 품질과 환각을 검증하는 데 우선순위가 부여됩니다. 에이전트 시스템의 경우 도구 선택 품질 및 작업 완료를 확인하는 데 우선 순위가 부여됩니다.

빠른 통합 예(Python):

``파이썬 갈릴레오에서 가져오기 GalileoLogger

galileo_logger = 갈릴레오로거(project="my-project") galileo_logger.start_trace("user-query")를 추적으로 사용: Trace.log_input("사용자 문제") 응답 = llm_call(프롬프트) 추적.로그_출력(응답) 추적.log_metric("대기 시간", 320)



## 제품 가격

Galileo의 가격 페이지에는 추적 수와 프리미엄 기능 적용 범위를 핵심 청구 차원으로 하는 3계층 계획이 나와 있습니다.

| 계획 | 공개 가격 | 핵심 할당량 | 주요 역량 | 적용 가능한 경계 |
|---|---|---|---:|---|
| 무료 | $0/월 | 월간 추적 5,000개, 사용자 무제한, 사용자 정의 평가 무제한 | 기본평가, 커뮤니티 지원 | 실험 및 소규모 개념 증명 |
| 프로 | 월 $100부터 시작 (연간 결제 시 33% 할인) | 월간 추적 50,000개, 표준 RBAC | 고급 분석 통찰력, Slack 지원 | 팀 성장, 소규모 생산 |
| 기업 | 저희에게 연락하세요 | 무제한 추적, 맞춤형 비율 제한 | VPC/온프레미스, SSO/RBAC, 실시간 가드레일, 전용 추론 연중무휴 지원 전용 CSM | 엔터프라이즈 규모, 규정 준수 및 배포 요구 사항 |

**Luna-2 비용 비교**: Luna-2(3B/8B)의 평가 비용은 $0.12/1M 토큰입니다. GPT-5.4의 $5.00/1M 토큰 및 GPT-5.4 mini의 $0.15/1M 토큰과 비교하면 고주파 평가 시나리오에서 분명한 이점이 있습니다. 그러나 Luna 지표의 활성화 조건, 특정 지표 적용 범위 및 추론 서버 구성은 모두 기업 계약을 통해 확인되어야 하며, 공개 가격을 기반으로 총액을 직접 추정할 수는 없습니다.

**과금 위험 포인트**: AI 평가의 최종 비용은 추적량 × 샘플링 속도 × 지표 수 × 호출 빈도에 따라 결정됩니다. 무료 및 프로 플랜의 추적 상한은 심층 평가 중에 빠르게 소진될 수 있습니다. Enterprise에는 추적에 대한 상한선이 없지만 사용자 지정 속도 제한과 배타적 추론 비용에는 비즈니스 협상이 필요합니다. 구매 전 비용 시뮬레이션을 위해 1~2주간의 실제 추적 데이터를 활용한 후 해당 솔루션을 선택하는 것이 좋습니다.

## 애플리케이션 시나리오

- **RAG 품질 측정 및 회귀**: 검색 정확도, 문맥 관련성, 답변 환상 및 인용 일관성을 측정합니다. 수용의 초점은 검색 지표를 비즈니스 근거와 일치시키고 단일 수동 평가에 의존하는 대신 각 모델 업데이트 후에 회귀 보고서가 자동으로 트리거될 수 있는지 여부입니다.
- **AI 에이전트 전체 링크 관찰**: 다단계 에이전트 도구 호출, 분기, 핸드오프, 작업 완료 및 대화 품질 모니터링에 사용됩니다. 수용의 초점은 실패한 에이전트 상호 작용의 근본 원인을 5분 이내에 Insights에서 찾아 개선 사항을 프롬프트 또는 도구 스키마에 피드백할 수 있는지 여부입니다.
- **보안 및 규정 준수 실시간 가드레일**: 신속한 삽입, PII 유출, 유해 콘텐츠, 교차 사용자 작업, 무단 도구 호출 등 고위험 시나리오에 사용됩니다. 수용 초점은 낮은 대기 시간 차단(Luna의 200ms 미만 수준), 잘못된 차단 비율, 감사 로그 무결성 및 수동 폴백 메커니즘에 있습니다.
- **평가 엔지니어링 플랫폼**: 데이터세트, 실험, 사용자 정의 측정항목, 인적 피드백 및 릴리스 게이트를 CI/CD 프로세스에 통합하는 데 사용됩니다. 수용의 초점은 모델이나 프롬프트가 업데이트될 때마다 파이프라인이 자동으로 실행될 수 있는지 평가하고 통과/실패 신호를 보내는 것입니다.
- **엔터프라이즈 AI 운영 거버넌스 및 비용 제어**: 생산 추적, Luna 평가 비용, 심사관으로서의 LLM 비용 및 부서 전체의 비정상적인 추세를 집계하는 데 사용됩니다. 수용의 초점은 권한 격리, 데이터 보존, 배포 격리 및 비용 귀속이 조직 요구 사항을 충족하는지 여부입니다.

## 해당자

- **AI응용엔지니어링팀**: 로그, 리뷰, 온라인 이상 징후 진단 등을 하나의 뷰로 통합하기 위해 RAG, Agent, 고객 서비스 로봇 또는 검색 Q&A 시스템을 구축하는 팀입니다. 전제 조건은 팀이 로그 매장 및 추적에 대한 기본 개념을 갖추고 있어야 하며, 전임 AI 플랫폼 엔지니어가 필요하지 않다는 것입니다.
- **AI 품질 및 평가 엔지니어(Eval Engineer)**: 평가 데이터 세트 구축, 지표 보정, 실험 관리 및 릴리스 액세스 제어 설계를 구체적으로 담당하는 엔지니어링 역할입니다. Galileo의 사용자 정의 평가판, 자동 조정 및 Luna Studio는 이 역할을 위한 핵심 도구 체인입니다.
- **제품 및 도메인 전문가(SME)**: 주석에 참여하고 답변 품질을 평가하며 비즈니스 성공 기준을 정의해야 하는 제품 관리자 및 비즈니스 전문가입니다. 주석과 맞춤형 평가기를 통해 주관적인 판단을 추적 가능하고 재사용 가능한 품질 지표로 변환합니다.
- **플랫폼 및 보안 운영 팀**: SSO/RBAC, 데이터 보존, 생산 가드레일 PII 및 프롬프트 주입 위험 제어가 필요한 엔터프라이즈 플랫폼 팀입니다. Galileo의 Enterprise 솔루션과 Agent Control은 이 그룹의 주요 가치 포인트입니다.

**부적절한 상황**: 일반 채팅이나 간단한 LLM 통화(칼로 닭 죽이기)만 필요한 팀 온라인 AI 애플리케이션이 없거나 추적/데이터 세트를 제공할 수 없는 조직(플랫폼에 분석할 데이터가 없음) 명확한 평가 리더 또는 지표 거버넌스 프로세스가 없는 팀(도구는 "하나 이상의 대시보드"가 됨) 데이터 상주에 대한 엄격한 지리적 요구 사항이 있지만 Galileo는 아직 해당 영역을 다루지 않은 시나리오입니다.

## 요약 및 전망

Galileo의 핵심 역량은 GenAI 평가 에이전트 관찰 가능 Luna-2 짧은 지연 시간 평가 모델과 생산 가드레일을 동일한 워크플로에 배치하는 데 있습니다. 이는 POC에서 프로덕션으로 전환된 후 엔터프라이즈 AI의 가장 어려운 문제, 즉 모델과 에이전트가 신뢰할 수 있고 설명 가능하며 개선 가능하고 실제 트래픽에서 위험을 예방할 수 있음을 지속적으로 증명하는 방법을 해결합니다. AI 평가 트랙에서 갈릴레오는 단일 지점 지표 도구가 아닌 '오프라인 실험 → 온라인 관찰 → 실시간 가드레일'의 완전한 링크를 동시에 다루는 몇 안 되는 제품 중 하나이다.

현재 한계 및 불확실성: Luna-2의 정확도 0.95는 GPT-5.4의 0.94보다 높지만 이는 특정 평가 차원에서 벤치마크 테스트 결과입니다. 고도로 맞춤화된 비즈니스 시나리오에서 동일한 품질을 유지할 수 있는지 여부는 실제 검증이 필요합니다. 일부 엔터프라이즈 기능(Luna Studio, Agent Control)을 활성화하려면 비즈니스 확인이 필요합니다. SDK/에이전트 프레임워크 통합의 깊이는 현재 기술 스택 및 Otel 호환성에 따라 다릅니다. 평가 지표의 장기적인 정확성은 사실에 달려 있습니다. 지속적인 유지 관리 및 SME 피드백.

**조달/채택 위험 평가**: 먼저 파일럿으로 2~4주 동안 고가치의 측정 가능한 RAG 또는 에이전트 프로세스를 선택하고 추적 범위, 실패 위치 시간, 수동 검토 양, 차단 허위 경보 비율, 온라인 액세스 제어 통과 비율 등의 지표를 설정하는 것이 좋습니다. 지표가 안정적이고 팀이 평가 프로세스에 대한 합의에 도달하면 다중 팀, 다중 에이전트 또는 엔터프라이즈 배포로 확장합니다. 구매하기 전에 기업은 다음 사항을 검토하는 데 집중해야 합니다. VPC/온프레미스 조건 및 데이터 상주가 규정 준수 요구 사항을 충족하는지 여부 현재 계약 범위 내에서 Luna-2 및 Luna Studio의 활성화 범위 및 수수료 구조; SSO/RBAC와 기업 ID 관리 시스템(IdP)의 호환성; 실제 응답 시간 및 연중무휴 지원의 업그레이드 경로 계약 종료 시 데이터 내보내기 및 마이그레이션 지원 조건.

관련 도구: hugging-face, replicate

버전 정보

  • 기업 고객을 위한 에이전트 제어 :공식 릴리스 노트에서는 가드레일을 중앙에서 정의하고 기업 고객을 위한 에이전트 거버넌스를 관리하는 Agent Control을 출시했습니다. 에이전트 코드를 변경하지 않고도 유해 콘텐츠 프롬프트 삽입, PII 유출 및 기타 위험을 차단할 수 있습니다.
  • Luna Studio 및 통합 비용 차트 :공식 릴리스 노트에서는 대기 시간이 짧고 비용이 저렴한 SLM 지표를 교육하기 위한 Luna Studio 엔터프라이즈 기능의 출시와 판사로서의 LLM 비용을 추적하기 위한 통합 비용 관리 페이지 추가를 발표했습니다.
  • 에이전트 신뢰성 플랫폼 :공식 블로그는 Graph Engine, Insights Engine 및 Luna-2 실시간 가드레일을 중심으로 다중 에이전트 시스템 관찰, 오류 모드 분석 및 생산 보호를 지원하는 무료 에이전트 신뢰성 플랫폼을 발표했습니다.
  • 평가 인텔리전스 플랫폼 :공식 블로그에서는 시리즈 B 자금 조달로 4,500만 달러를 발표했으며 주요 제품 라인을 Fine-Tune, Evaluate, Observe, Protect 등 AI 품질 수명 주기를 다루는 평가 인텔리전스 플랫폼으로 정의했습니다.

사용자 후기

  • 후기를 불러오는 중...