Galileo
免费
Galileo 是面向 AI训练模型 场景的 GenAI 评测AI 可观测与生产护栏平台,覆盖离线实验RAG/Agent 指标、线上 traces、低延迟 Luna-2 评测模型和企业级部署。
Galileo
核心参数与统计
Galileo 把自己定位为 AI reliability platform,核心交付是"让离线评测变成生产护栏"的一体化工作流。产品覆盖 AI Evaluation、AI Observability、Real-time Protection 三大模块,通过 SDK、API 和 Web 控制台接入,支持 SaaS、VPC 和 On-Premises 三种部署方式。
| 项目 | 公开信息 |
|---|---|
| 产品定位 | GenAI 与 Agentic 应用的评测、可观测与生产护栏平台 |
| 核心对象 | traces、sessions、spans、datasets、prompts、metrics、guardrails |
| 预置指标 | 20+ out-of-box evals,覆盖 RAG、Agent、Safety、Security 等类别 |
| 接入方式 | Web 控制台Python SDK、TypeScript SDK、REST API、主流 Agent 框架集成 |
| 工作流覆盖 | 离线实验(Evaluate)、线上观测(Observe)、实时护栏(Protect) |
| 部署形态 | SaaS、Virtual Private Cloud、On-Premises |
| Luna-2 评测模型 | $0.12/1M tokens,0.95 accuracy,152ms 平均延迟,128k 上下文 |
| 最新公开更新 | 2026-06-05 Agent Control for enterprise customers |
| 定价方案 | Free / Pro ($100/mo) / Enterprise(Contact us)三层 |
边界说明:Galileo 不是通用聊天机器人或纯日志平台。它要求团队已经有 GenAI、RAG 或 Agent 应用,并愿意投入时间构建 groundtruth、校准指标和定义护栏策略。如果团队尚未进入 AI 应用开发或缺少评测方法论,平台初期的 onboarding 成本会高于工具本身的价格。
用户与市场认可
Galileo 的市场信号集中在企业级客户采用和资本认可两个维度,而非 C 端口碑或 GitHub 星标。
融资与企业增长:2024 年 10 月官方公告完成 4500 万美元 Series B,累计融资 6800 万美元;同一公告披露 2024 年以来营收增长 834%、企业客户数增长 4 倍、引入 6 家 Fortune 50 公司。投资方未在公开页面披露,但融资规模在 AI 评测赛道属于头部级别。
客户与生态伙伴:产品页和定价页出现 Twilio、Comcast、HP、Writer、Cisco Outshift、Ema、NVIDIA、Satisfi Labs、MongoDB、CrewAI、Clearwater Analytics 等客户或合作伙伴评价。评价集中在"用 Galileo 做 Agent 观测Luna-2 生产评测和 RAG 质量治理",说明其使用重心在企业级 AI 治理场景。
开发者社区:GitHub 组织 rungalileo 拥有 184 followers、58 个仓库,主要开源项目包括 agent-leaderboard(224 stars,用于 LLM Agent 能力排名)、hallucination-index(116 stars,评估 LLM 幻觉倾向)、galileo-python SDK(22 stars,Apache-2.0 许可)。开源仓库更多是展示和集成示例,产品核心能力在闭源 SaaS 层。
成本优势
Galileo 的成本结构与传统 LLM 监控工具有根本区别:它不依赖每次都调用 GPT-5.4 或 Claude 来做 judge,而是通过 Luna-2 专用评测模型把高频评估成本降到通用方案的 3%-5%。
C 端/个人:Free 方案 $0/month,包含 5,000 traces/month、unlimited users、unlimited custom evals。适合个人开发者做小规模概念验证。限制在于免费额度远低于生产有境需求(高频 Agent 系统一天可产生数万条 traces),且缺少 SSO、RBAC 和专属支持。
开发者/API:Pro 方案 $100/month 起(年付标注节省 33%),包含 50,000 traces/month、Standard RBAC、高级分析和 Slack 支持。定价页注明价格随 traces 数量线性扩展。开发团队的实际费用不仅包括订阅费,还需叠加 LLM-as-a-judge 调用Luna 指标、数据保留和实验存储的开销。
企业/私有化:Enterprise 为 Contact us,包含 unlimited traces、custom rate limits、Hosted/VPC/on-prem 部署选项、企业级 RBAC/SSO、Dedicated CSM、实时护栏24/7 支持、低延迟专属推理服务器和 forward deployed engineering 支持。Luna-2 的 $0.12/1M tokens 对比 GPT-5.4 的 $5.00/1M tokens 能节省约 97% 的评估成本,但 Luna metrics 按企业合同开放,并非所有用户默认可用。
隐性成本:AI 评测的真实成本不仅来自 Galileo 订阅,还包括:评测指标的构建和校准投入LLM-as-a-judge 调用费用、数据留存和带宽、专用推理服务器的运维,以及团队学习和制定评测流程的时间。Luna-2 降低了高频评测的边际成本,但前期 groundtruth 建设和指标优化的 Engineering 投入不可忽视。
主要功能
Galileo 的功能围绕"数据捕获 → 评测构建 → 失败分析 → 护栏上线"四个阶段组织,而非按模块独立堆叠。
- 数据与标注资产管理:从合成数据、开发有境和生产流量中构建数据集,支持领域专家标注(annotations)形成持续更新的 groundtruth 资产。关键验收点是标注工作流能否与现有数据管道对接,以及 groundtruth 的版本管理与回滚机制。
- 20+ 预置评测指标 + 自定义评测:覆盖 RAG Evals(retrieval quality、context precision)、Agent Evals(tool selection、action advancement、action completion)、Safety Evals(bias、toxicity)、Security Evals(prompt injection、PII leak)。自定义评测支持 code-based 或 LLM-as-judge 自动生成。关键验收点是预置指标是否与业务 domain 对齐,自定义指标的准确率(F1)能否达到 80% 以上。
- Graph Engine Agent 观测:把 Agent 的分支、工具调用、决策路径和会话上下文从线性日志扩展为图形路径,支持多 Agent 系统A2A 协议和分布式追踪。关键验收点是能否快速定位一个失败 span 并在 2-3 次点击内看到完整的归因链路。
- Insights Engine 自动失败分析:分析 Agent 行为数据,识别失败模式、隐藏模式和根因,给出 actionable suggestions(如"向 tool input 添加 few-shot 示例")。关键验收点是建议的准确率和误报率,以及工程团队采纳建议的比率。
- Luna-2 生产级评测:用 3B/8B 参数的 SLM 替代通用 LLM-as-judge,实现 sub-200ms 延迟128k 上下文、$0.12/1M tokens 的低成本评测。关键验收点是 Luna 指标与人工标注的一致性,以及在高 QPS 下的延迟稳定性。
- Agent Control 集中护栏治理:以一个集中控制面定义护栏策略,在不改动 Agent 代码的情况下阻断有害内容Prompt Injection、PII 泄露、跨用户操作等风险。关键验收点是误拦截率、审计日志完整性和人工回退路径。
- Auto-tune 与 Continuous Learning:通过 CLHF(Continuous Learning with Human Feedback)机制,利用 few-shot 示例自动优化评测 prompt,逐步提升指标准确率。关键验收点是 auto-tune 的生效周期和是否需要频繁人工干预。
模型与版本演进
Galileo 是一个持续迭代的 SaaS 平台,版本脉络按官方公开里程碑可分为四个阶段:
主线里程碑
- 2024-10-15:Evaluation Intelligence Platform。Series B 公告重新定义产品主线为 Evaluation Intelligence,覆盖 Fine-Tune、Evaluate、Observe、Protect 四个阶段,强调从离线实验到生产治理的全链路。这是 Galileo 从早期 NLP 工具转向 GenAI 评测平台的关键转折。
- 2025-07-16:Agent Reliability Platform。免费发布 Agent Reliability Platform,引入 Graph Engine(Agent 路径观测)、Insights Engine(自动失败分析)和 Luna-2(低延迟评测模型),把产品重心从"RAG 评测"扩展到"Agent 全生命周期可靠性"。
- 2026-05-22:Luna Studio 与 Integration Costs。Release Notes 发布 Luna Studio 企业能力,允许企业训练自定义低延迟 SLM 指标;同时加入 Integration Costs 成本管理页,让团队可视化追踪 LLM-as-judge、Luna 和保留的支出结构。
- 2026-06-05:Agent Control。Release Notes 发布企业 Agent Control,用集中控制面管理护栏与治理策略,可不改代码阻断 Prompt Injection、PII 泄露、跨用户操作等风险。这是 Galileo 从"观测+评测"向"治理+阻断"方向的一次产品延伸。
验证重点
2026-06-05 Agent Control 是当前最新公开能力节点,但实际可用性受企业套餐、部署形态和销售开通影响。Luna metrics 在 Luna-2 页面标注"仅按请求向客户开放",不能把所有预置指标视为默认即开即用。企业采购时需确认 Luna Studio 和 Agent Control 在当前合同范围内的具体开通条件。
技术优势
Galileo 的技术优势来自评测模型、观测数据和生产护栏的三层闭有,而非单点模型或单一指标。
评测模型层(Luna-2):Luna-2 使用 decoder-only SLM 搭配 lightweight metric heads 做确定性评测输出。机制上,它在 3B/8B 基座上通过 fine-tuning 和 adapter 适配不同评测维度;效果上,$0.12/1M tokens 对比 GPT-5.4 的 $5.00/1M tokens 降低了约 97% 的每次评估成本,同时保持 0.95 准确率;适用场景是高频、多指标并行的生产有境评测,如客服 Agent、RAG 问答和金融合规检查。Luna-2 的 128k 上下文窗口意味着它支持长对话场景的端到端评估,而同价位竞品(如 Azure Content Safety)的 3k 窗口会丢失上下文。
观测层(Graph Engine):Graph Engine 把 Agent 调用从线性日志转化为有向图,每个节点是一个工具调用或 LLM 请求,边是信息流和控制权转移。机制上,它通过 OpenTelemetry 扩展和 SDK 埋点捕获 spans 和 traces,再在后端重建路径拓扑;效果上,工程团队可以在一次观测中看到 Agent 的全部分支、重试和错误路径;适用场景是多 Agent 协作A2A 协议MCP server 调用等复杂编排场景。
护栏层(Agent Control):Agent Control 把评测分数直接映射为执行控制动作。机制上,护栏杆在工具调用前根据预定义策略判定是否允许执行;效果上,团队不需要修改 Agent 代码就能阻断有害操作;适用场景是 PII 泄露防护Prompt Injection 阻断、跨用户操作拦截和经济损失风险控制(如单笔转账上限)。
工程可观测性基础:Galileo 的 Insights Engine 不是简单的日志聚合,而是对百万级 signals(模型prompts、函数、上下文datasets、traces、MCP server)做模式识别。产品页展示了一个案例:Galileo 自动检测到"幻觉导致错误 tool inputs",并给出"添加 few-shot 示例以演示正确的工具输入"的建议,说明其 root cause 分析能力已从统计汇总升级到规则生成。
如何使用
Galileo 的入口分为 Web 控制台SDK/API 和企业部署三类。开发者可以从免费注册开始,企业团队通常需要先明确数据边界和合规要求。
| 使用方式 | 适合人群 | 主要动作 | 注意事项 |
|---|---|---|---|
| Web 控制台 | 产品、运营AI 质量负责人 | 查看 traces/sessions/metrics,运行 experiments,配置 guardrails | 需要先接入应用日志或导入评测数据 |
| Python SDK(galileo-python) | 工程团队ML 工程师 | pip install galileo → 初始化 GalileoLogger → 记录 traces 和 experiments |
需管理 API Key、项目 Key、日志字段和采样策略 |
| TypeScript SDK(galileo-js) | Agent 开发者、全栈工程师 | npm install @rungalileo/galileo-js → 初始化客户端 → 接入 Agent 框架 |
需配合框架(LangGraph、CrewAI 等)的 middleware 或 callback |
| REST API | 多语言有境、定制集成 | 调用 /v1/traces、/v1/experiments、/v1/guardrails 等端点 |
需自行处理鉴权、限流和错误重试 |
| Enterprise 部署 | 安全、合规和平台团队 | 评估 Hosted / VPC / On-Prem 方案 | 需商务确认合同、数据驻留SLA 和专用推理 |
典型上手路径:从官网免费注册 → 创建一个 project → 安装 SDK 记录第一条 trace → 对 traces 运行预置评测指标 → 在 Insights 中查看失败模式 → 把稳定指标扩展为 experiment 和 guardrail。对 RAG 系统优先验证 retrieval quality 和 hallucination;对 Agent 系统优先验证 tool selection quality 和 action completion。
快速集成示例(Python):
from galileo import GalileoLogger
galileo_logger = GalileoLogger(project="my-project")
with galileo_logger.start_trace("user-query") as trace:
trace.log_input("用户问题")
response = llm_call(prompt)
trace.log_output(response)
trace.log_metric("latency", 320)
产品定价
Galileo 的定价页公开了三层方案,核心计费维度是 traces 数量和高级功能覆盖范围。
| 方案 | 公开价格 | 核心额度 | 关键能力 | 适用边界 |
|---|---|---|---|---|
| Free | $0/month | 5,000 traces/month、unlimited users、unlimited custom evals | 基础评测、社区支持 | 实验和小规模概念验证 |
| Pro | $100/month 起(年付 33% 折扣) | 50,000 traces/month、Standard RBAC | 高级分析Insights、Slack 支持 | 成长型团队、小规模生产 |
| Enterprise | Contact us | Unlimited traces、custom rate limits | VPC/on-prem、SSO/RBAC、实时护栏、专属推理24/7 支持Dedicated CSM | 企业级规模、合规和部署要求 |
Luna-2 成本对比:Luna-2(3B/8B)的评测成本为 $0.12/1M tokens,对比 GPT-5.4 的 $5.00/1M tokens 和 GPT-5.4 mini 的 $0.15/1M tokens,在高频评测场景下优势明显。但需注意 Luna metrics 的开通条件、具体指标覆盖和推理服务器配置均需企业合同确认,不能直接按公开价格估算总量。
计费风险点:AI 评测的最终费用由 traces 量 × 采样率 × 指标数量 × 调用频率共同决定。Free 和 Pro 方案的 traces 上限在深度评测时可能快速耗尽;Enterprise 虽然 traces 无上限,但 custom rate limits 和专属推理的成本需要商务洽谈。建议采购前用 1-2 周的实际 traces 数据做成本仿真,再选择对应方案。
应用场景
- RAG 质量评测与回归:用于衡量检索精度、上下文相关性、答案幻觉和引用一致性。验收重点是 retrieval 指标与业务 groundtruth 的对齐度,以及每次模型更新后能否自动触发生成回归报告,而不是仅靠单次人工评估。
- AI Agent 全链路观测:用于多步 Agent 的 tool call、branch、handoff、action completion 和 conversation quality 监控。验收重点是能否在 Insights 中 5 分钟内定位一次失败 Agent 交互的根因,并把改进反馈到 prompt 或 tool schema。
- 安全与合规实时护栏:用于 Prompt Injection、PII 泄露、有害内容、跨用户操作和越权工具调用等高风险场景。验收重点是低延迟阻断(Luna 的 sub-200ms 级别)、误拦截率、审计日志完整性和人工回退机制。
- 评测工程(Eval Engineering)平台化:用于把 datasets、experiments、custom metrics、human feedback 和 release gate 接入 CI/CD 流程。验收重点是评测 pipeline 能否在每次模型或 prompt 更新时自动执行,并给出通过/失败信号。
- 企业 AI 运营治理与成本管控:用于跨部门汇总生产 traces、Luna 评测成本LLM-as-judge 费用和异常趋势。验收重点是权限隔离、数据留存、部署隔离和成本归因是否满足组织要求。
适用人群
- AI 应用工程团队:正在构建 RAG、Agent、客服机器人或搜索问答系统的团队,用来把日志、评测和线上异常诊断统一到单一视图。前置条件是团队有基本的日志埋点和 traces 概念,不需要专职 AI 平台工程师。
- AI 质量与评测工程师(Eval Engineer):专门负责构建评测数据集、校准指标、管理 experiments 和设计发布门禁的工程角色。Galileo 的 custom evals、auto-tune 和 Luna Studio 是这个角色的核心工具链。
- 产品与领域专家(SME):需要参与标注、评价答案质量、定义业务成功标准的产品经理和业务专家。通过 annotations 和 custom evaluators 把主观判断转化为可追踪、可复用的质量指标。
- 平台与安全运维团队:需要 SSO/RBAC、数据保留、生产护栏PII 和 Prompt Injection 风险控制的企业平台团队。Galileo 的 Enterprise 方案和 Agent Control 是这个群体的主要价值点。
不太适合的情况:只需要通用聊天或简单 LLM 调用的团队(杀鸡用牛刀);没有线上 AI 应用或无法提供 traces/datasets 的组织(平台没有数据可分析);团队暂时没有明确的评测负责人或指标治理流程(工具会变成"多一个仪表盘");对数据驻留有严格地缘要求但 Galileo 尚未覆盖对应区域的场景。
总结与展望
Galileo 的核心竞争力在于把 GenAI 评测Agent 可观测Luna-2 低延迟评测模型和生产护栏放进同一套工作流。它解决的是企业 AI 从 POC 到生产后最棘手的问题:如何持续证明模型和 Agent 在真实流量里可靠、可解释、可改进、可阻断风险。在 AI 评测赛道中,Galileo 是少数同时覆盖"离线实验 → 线上观测 → 实时护栏"完整链路的产品,而非单点指标工具。
当前限制与不确定项:Luna-2 的 0.95 准确率虽高于 GPT-5.4 的 0.94,但这是在特定评测维度下的基准测试结果,在高度定制化的业务场景中能否保持同等质量需实际验证;部分企业能力(Luna Studio、Agent Control)需要商务确认开通;SDK/Agent 框架集成的深度取决于当前技术栈和 OTel 兼容性;评测指标的长期准确性依赖于 groundtruth 的持续维护和 SME 反馈。
采购/采用风险评估:建议先选择 1 个高价值、可度量的 RAG 或 Agent 流程做 2-4 周试点,设定 trace 覆盖率、失败定位时间、人工复核量、拦截误报率和上线门禁通过率等指标。当指标稳定且团队对评测流程形成共识后,再扩展到多团队、多 Agent 或企业部署。企业采购前应重点复核:VPC/on-prem 条款与数据驻留是否满足合规要求;Luna-2 和 Luna Studio 在当前合同范围内的开通范围与费用结构;SSO/RBAC 与企业身份管理系统(IdP)的兼容性;24/7 支持的实际响应时间和升级路径;以及合同终止时的数据导出和迁移支持条款。
限制与不适配场景
该工具在以下场景中存在使用限制:
场景适配边界 需要高度行业专业知识的任务、对输出格式有严格规范的场景、需要零错误的自动化流程可能效果不达预期。AI 输出应作为初稿或辅助参考,最终结果需人工核验。
技术限制 上下文长度有限、复杂推理准确性可能不足、免费版有使用额度。建议在正式采用前通过试用验证核心场景的可用性。
版本信息
- Agent Control for enterprise customers :官方 Release Notes 发布 Agent Control,面向企业客户集中定义护栏并管理 Agent 治理,可在不改动 Agent 代码的情况下阻断有害内容Prompt Injection、PII 泄露等风险。
- Luna Studio and Integration cost charts :官方 Release Notes 发布 Luna Studio 企业能力,用于训练低延迟、低成本的 SLM 指标,并加入 Integration Costs 管理页以跟踪 LLM-as-a-judge 成本。
- Agent Reliability Platform :官方博客宣布免费的 Agent Reliability Platform,围绕 Graph Engine、Insights Engine 与 Luna-2 实时护栏,支持多 Agent 系统观测、失败模式分析与生产保护。
- Evaluation Intelligence Platform :官方博客宣布 4500 万美元 B 轮融资,并把产品主线定义为 Evaluation Intelligence Platform,覆盖 Fine-Tune、Evaluate、Observe、Protect 等 AI 质量生命周期。
用户评价