ガリレオAI
無料
Galileo AI は、
ガリレオAI
コアパラメータと統計
Galileo AI の製品ページでは、このプラットフォームを AI 可観測性および評価エンジニアリング プラットフォームとして定義しており、その目的はオフライン評価を実稼働のガードレールに変えることです。ドキュメント ページではさらに、Galileo は GenAI およびエージェント アプリケーション向けであり、エンジニア、プロダクト マネージャー、ドメイン エキスパートにサービスを提供し、エージェント フレームワークの Python SDK、TypeScript SDK、または API を通じてアクセスできると説明しています (公式ドキュメント)。
| プロジェクト | 広報 |
|---|---|
| 製品のポジショニング | GenAI および Agentic アプリケーション向けの観察、評価、実稼働ガードレール プラットフォーム |
| 主要なオブジェクト | トレース、セッション、スパン、データセット、プロンプト、メトリック、ガードレール |
| メインシナリオ | RAG 評価、エージェント評価、安全性評価、セキュリティ評価、カスタム評価 |
| アクセス方法 | Web コンソール Python SDK、TypeScript SDK、API、共通エージェント/LLM フレームワークの統合 |
| 生産能力 | オフライン評価、オンライン観察、指標調整 Luna-2低遅延評価、リアルタイムガードレール |
| 導入フォーム | SaaS、仮想プライベート クラウド、オンプレミス |
| 最新の公開アップデート | 2026-06-05 企業顧客向けの Agent Control |
| 価格ポータル | Free、Pro、Enterprise の 3 層公開価格ページ |
機能の境界: Galileo AI は一般的なチャットボットでも、単純なログ プラットフォームでもありません。これは、すでに GenAI、RAG、または Agent アプリケーションを導入しており、品質を測定し、障害モードを特定し、本番リスクを制御する必要があるチームに適しています。チームがまだ AI アプリケーション開発に参入していないか、オンライン トラフィックがない場合、プラットフォームの価値は、即時のビジネス上のメリットではなく、評価方法の構築に反映されます。
ユーザーと市場の認識
Galileo の市場シグナルは主に法人顧客、融資、協力エコシステムから発信されます。シリーズBの公式発表では、ガリレオが2024年10月15日にシリーズBで4,500万米ドルを発表し、累計資金調達額は6,800万米ドルに達したことが明らかになった。同発表では、2024年以降、収益が834%増加し、企業顧客数が4倍に増加し、フォーチュン50企業6社が導入され、Twilio、Comcast、HP、ServiceTitanがリストアップされたことも明らかにした。顧客またはパートナーを待っています (公式発表)。
企業の承認: Writer、Cisco Outshift、Ema、NVIDIA、Satisfi Labs、MongoDB、CrewAI、HP、Clearwater Analytics などの顧客またはパートナーのレビューが製品ページと価格設定ページに表示されます。購入の判断においてさらに重要なことは、これらの評価が「評価ツール チェーン」、「エージェント観察」、「NVIDIA NeMo 統合」、および「Luna-2 実稼働評価」に焦点を当てていることです。これは、Galileo が個人の効率化ツールではなくエンタープライズ レベルの AI 品質管理に焦点を当てていることを示しています。
生態学的承認: 公式エージェント信頼性リリース記事では、Graph Engine が CrewAI、LangGraph、OpenAI Agents SDK、LlamaIndex およびその他のフレームワークをサポートしていることが明らかになりました。 2026-05-08 リリース ノートには、A2A マルチエージェント分散トレーシングと OpenTelemetry 拡張機能も追加されました。このタイプの生態学的適応によりアクセス コストが削減されますが、実際の可用性は依然としてチームの現在のフレームワーク、ログ記録標準、およびデータ保持要件に依存します。
コストメリット
Galileo AI のコスト上の利点は、「最安の SaaS サブスクリプション」ではなく、高価で遅い汎用 LLM-as-a-judge パイプラインを Luna-2 のような専用レビュー モデルに置き換えることです。製品ページには、Luna が最適化された評価を抽出してトラフィックを 100% 監視し、96% 低いコストで実行するモデルを抽出できると記載されています。 Agent Reliability リリースでは、Luna-2 は 200 ミリ秒未満の遅延を実行しながら 20 以上のインジケーターをサポートし、従来の LLM ベースのソリューションより 97% 安価であると述べています。
C クライアント/個人: 無料プランは月額 0 ドルで一般公開されており、月 5,000 トレース、無制限のユーザー、無制限のカスタム評価が含まれており、開発者や小規模チームがアイデアを検証および評価するのに適しています。制限は、無料クォータは主に実験と小規模アプリケーションを対象としており、エンタープライズ運用環境の SSO、専用サポート、展開の分離、およびデータ ガバナンスの要件を置き換えることはできないことです。
開発者/API: Pro プランは月額 100 ドルで公開されており、年間支払いが 33% 節約され、月額 50,000 トレース、標準 RBAC、高度な分析と洞察、および Slack サポートが含まれます。価格ページには、トレース数に応じて価格が変動することが示されています。開発チームは、トレースの量、評価インジケーターの数、LLM-as-a-judge コール、Luna インジケーター コール、およびログ保持を一緒に計算する必要があります。
エンタープライズ/プライベート: エンタープライズはお問い合わせください。これには、無制限のトレース、カスタム レート制限、ホスト/VPC/オンプレミス展開、エンタープライズ グレードの RBAC/SSO、専用 CSM、リアルタイム ガードレール、24 時間年中無休のサポート、低遅延の専用推論サーバー、および前方展開されたエンジニアリング サポートが含まれます。 VPC、オンプレミス、専用推論、およびセキュリティ条件に関しては、実際の見積もりと契約の境界は、公式のリアルタイム ページとビジネス確認の対象となります。
主な機能
Galileo AI の機能は、「実際のデータを取得し、評価を構築し、障害を発見し、評価をガードレールとしてオンラインに置く」ことを中心に展開されます。 AI の品質をオフライン テストからオンライン ガバナンスまで拡張するのに適しています。
- データおよびアノテーション アセット: 合成データ、開発データ、および実際の運用データからデータセットを構築し、ドメイン エキスパートのアノテーションを通じて継続的に更新されるグラウンドトゥルース アセットを形成します。
- RAG/エージェント/安全性/セキュリティ指標: 公式製品ページでは、RAG、エージェント、安全性、セキュリティをカバーする 20 を超えるすぐに使える評価を公開し、カスタム評価器をサポートしています。
- エージェント グラフとトレース観察: エージェントの信頼性ページの説明 グラフ ビューでは、各分岐、意思決定、およびツール呼び出しを表示でき、チームがマルチステップ エージェント パス内のオフセット ポイントを見つけるのに役立ちます。
- インサイト エンジン: エージェントの動作に関する障害モード分析を実行し、根本原因、複数エージェントのハンドオフ、ツール選択パターンを特定し、リンクされた証拠と実用的な提案を提供します。
- Luna-2 プロダクション評価: Luna-2 ページでは、低コスト、低レイテンシーのプロダクション評価のための、0.12 ドル/100 万トークン、精度 0.95、平均レイテンシー 152 ミリ秒、最大トークン 128,000 などの指標が公開されています。
- エージェント コントロールとガードレール管理: 2026-06-05 リリース ノートでは、エージェント コントロールがエンタープライズ エージェント ガードレールを一元管理して、有害なコンテンツ プロンプト インジェクションや PII 漏洩などのリスクをブロックできることが示されています。
モデルとバージョンの進化
関連情報は公開されていませんので、公式リアルタイムページをご参照ください。
技術的な利点
Galileo AI の技術的優位性は、単一点のモデルのパフォーマンスではなく、「評価モデル + 観測データ + 生産ガードレール」の組み合わせによってもたらされます。
専用評価モデル: Luna-2 は、高周波品質判定を行うための評価専用に設計された SLM を使用します。機械的には、高価な LLM-as-a-judge タスクを低遅延モデルに抽出します。実際、プラットフォームは高いサンプリング レートで運用トラフィックを継続的に評価できます。該当するシナリオは、カスタマー サービス エージェント、RAG Q&A、金融/医療など、継続的なリスク管理が必要なアプリケーションです。
エージェント ネイティブの観察: グラフ エンジンは、エージェントのブランチ、ツール呼び出し、意思決定パス、およびセッション コンテキストを統一された方法で表示します。機械的には、スパン/トレースを線形ログからグラフィック パスに拡張します。実際には、エンジニアリング チームがツールの選択、ハンドオフ、アクションの完了などのエラーを見つけやすくなります。適用可能なシナリオは、マルチステップ、マルチツール、およびマルチエージェントのビジネス フローです。
評価からガードレールへ: このプラットフォームは、オフライン インジケーター、オンライン シグナル、リアルタイム ブロッキングを接続します。機械的には、評価スコアによってアクション、ツールへのアクセス、エスカレーション パスを制御できます。実際、品質の判断はレポートに限定されず、運用環境での保護を引き起こす可能性があります。該当するシナリオは、PII 漏洩プロンプト挿入、有害な出力、または誤ったツール呼び出しに対して強い制約がある企業です。
使い方
Galileo AI への入り口は、製品コンソール SDK/API とエンタープライズ展開の 3 つのカテゴリに分かれています。開発者は、公式 Web サイトに無料で登録することから始めることができます。企業チームは通常、まずデータ境界、ログ保持ポリシー SSO/RBAC、展開フォームを明確にする必要があります。
| 使い方 | 誰にでも適しています | 主な取り組み | 注意事項 |
|---|---|---|---|
| ウェブコンソール | 製品および運用 AI 品質マネージャー | トレース、セッション、メトリクス、実験、洞察を表示 | 最初にアプリケーション ログにアクセスするか、実験データをインポートする必要があります。 |
| Python/TypeScript SDK | エンジニアリングチーム エージェント開発者 | 最初のトレースをログに記録し、実験を実行し、フレームワークにアクセスします。 API キー、プロジェクト キー、ログ フィールド、サンプリング戦略を管理する必要がある | |
| エージェント/LLM フレームワークの統合 | LangGraph、CrewAI、OpenAI Agents SDK などを使用するチーム | エージェント パス ツールの呼び出しとトレースを自動的に記録します。統合の深さは、現在のフレームワークのバージョンと OTel サポートによって異なります。 | |
| エンタープライズ展開 | セキュリティ、コンプライアンス、プラットフォーム チーム | ホスト型、VPC、またはオンプレミスのシナリオ評価 | ビジネス検証契約、データ常駐、サポート SLA、および専用推論が必要 |
一般的な実装パスは、最初に実際のトレースを記録し、次にトレース上で評価インジケーターを実行し、次に安定したインジケーターを実験とガードレールに拡張することです。 RAG システムの場合、検索品質、コンテキストの精度、幻覚の検証が優先されます。エージェント システムでは、ツールの選択の品質、アクションの進行状況、アクションの完了、会話の品質の検証が優先されます。
製品の価格設定
Galileo AI の価格ページには、Free、Pro、Enterprise の 3 つのレベルがあります。 Free は開発者と小規模チーム向け、Pro はより自信を持って運用を開始したいチーム向け、Enterprise は規模、セキュリティ、高度なサポートを必要とする組織向けです。
| 計画 | 公開価格 | 公開割り当て/容量 | 適用境界 |
|---|---|---|---|
| 無料 | $0/月 | 5,000 トレース/月、無制限のユーザー、無制限のカスタム評価 | 実験、評価コンセプト、初期段階の小規模チーム |
| プロ | 月額 100 ドルから始まり、年払い。トレース付きの価格スケール | 50,000 トレース/月、標準 RBAC、高度な分析と洞察、Slack サポート | 小規模な生産チームまたは成長中のチーム |
| エンタープライズ | お問い合わせ | 無制限のトレース、カスタム レート制限、ホスト/VPC/オンプレミス、RBAC/SSO、リアルタイム ガードレール、年中無休のサポート、専用推論サーバー | エンタープライズ規模、コンプライアンス、プライベートまたは専用のサポート |
請求リスク ポイント: AI 評価コストには、Galileo サブスクリプションから発生するだけでなく、LLM-as-a-judge モデルの呼び出し、データ保持、評価指標の数、トレース サンプリング レート、専用推論サーバー、内部運用とメンテナンスも含まれます。 Luna-2 は高頻度評価のコストを削減できますが、Luna メトリクスの有効化条件、特定の指標の適用範囲、法人契約条件は依然として公式のリアルタイム ページとビジネス確認に従う必要があります。
アプリケーションのシナリオ
- RAG 品質測定: 検索品質、文脈の関連性、回答の錯覚、引用の一貫性を測定します。承認の焦点は、単一の Q&A デモを見るだけではなく、検索指標が実際のビジネスのグラウンドトゥルースと一致しているかどうかです。
- AI エージェントの本番監視: ツールの呼び出し、分岐、ハンドオフ、アクションの完了、およびマルチステップ エージェントの会話品質の監視に使用されます。承認の焦点は、障害が発生したスパンを迅速に特定でき、提案をプロンプト、ツール スキーマ、またはプロセス設計にフィードバックできるかどうかです。
- セキュリティとコンプライアンスのガードレール: プロンプト インジェクション、PII 漏洩、有害なコンテンツ、不正なツール呼び出しなどの高リスク シナリオに使用されます。受け入れの焦点は、低遅延ブロッキング、誤検知率、監査ログ、および手動ロールバック メカニズムです。
- 評価エンジニアリング プラットフォーム: データセット、実験、カスタム メトリクス、人間によるフィードバック、リリース ゲートを研究開発プロセスに統合するために使用されます。承認の焦点は、CI/CD またはリリースのアクセス制御が、1 回限りの手動レビューに依存せずに安定して再利用できるかどうかです。
- エンタープライズ AI 運用ガバナンス: 部門全体の生産トレース、コスト、例外、改善提案を集約するために使用されます。承認の焦点は、権限、データ保持 VPC/オンプレミス、SSO/RBAC、およびサポート SLA が組織の要件を満たしているかどうかです。
該当する人
- AI アプリケーション エンジニアリング チーム: RAG、エージェント、カスタマー サービス ロボット、検索 Q&A、またはログ、レビュー、オンライン異常診断を 1 つのプラットフォームに統合する自動化ワークフローを構築しているチームに適しています。
- 製品およびドメインのエキスパート: アノテーションに参加し、回答の品質を評価し、ビジネスの成功基準を定義する必要があるプロダクト マネージャーおよび SME に適しています。注釈とカスタム eval を使用して、主観的な判断を追跡可能な指標に変換します。
- プラットフォーム & セキュリティ チーム: SSO/RBAC、データ保持、運用ガードレール PII、およびプロンプト インジェクション リスク コントロールを必要とするエンタープライズ プラットフォーム チーム向け。
- 高頻度実験チーム: プロンプト、モデル、データセット、実験を比較し、スポット テストを体系的な評価にアップグレードする必要がある AI 製品チームに適しています。
あまり適切ではない状況は、一般的なチャットのみが必要である、オンライン AI アプリケーションがない、トレース/データセットが提供できない、またはチームに一時的にインジケーター ガバナンス リーダーがいない場合です。 Galileo AI の価値は、継続的な測定と継続的な改善から生まれます。データ フローと組織の所有者がなければ、プラットフォームは「もう 1 つのダッシュボード」になります。
概要と展望
Galileo AI の中核となる能力は、GenAI 評価エージェントの観察可能な Luna-2 低遅延評価モデルと運用ガードレールを同じワークフローに組み込むことにあります。これは、POC から本番環境に至るまでのエンタープライズ AI の最も困難な部分、つまり、モデルとエージェントが信頼性があり、説明可能で、改善可能であり、実際のトラフィックにおけるリスクをブロックできることを証明する方法を解決します。
現在の制限も非常に明確です。一部のエンタープライズ機能にはビジネスの確認が必要であり、Luna メトリクスは要求に応じてアクティブ化されます。価格はトレースおよびエンタープライズ条件に応じて変化します。 SDKとフレームワークの統合が正常に実装できるかどうかは、既存のアーキテクチャに依存します。評価指標には、ビジネスのグラウンドトゥルースと SME からのフィードバックを継続的に調整する必要があります。リスクの高い業界では、Galileo の自動評価結果と手動監査、コンプライアンス プロセス、セキュリティ テストを組み合わせる必要が依然としてあります。
実装に関する提案としては、まず、パイロット用に価値の高い測定可能な RAG またはエージェント プロセスを選択し、トレース カバレッジ、障害位置時間、手動レビュー量、傍受誤報率、オンライン アクセス コントロールの合格率などの指標を設定します。指標が安定したら、マルチチーム、マルチエージェント、またはエンタープライズ展開に拡張します。企業は購入前に、VPC/オンプレミス条件、SSO/RBAC、データ保持 Luna-2 アクティベーション範囲、専用推論コスト、24 時間年中無休のサポート境界の確認に重点を置く必要があります。
Galileo AI のバージョンと製品の進化
Galileo AI は、従来のデスクトップ ソフトウェアのような固定バージョン番号を持たない、継続的に反復されるクラウド プラットフォームです。より適切なバージョン コンテキストは、評価インテリジェンス、エージェント信頼性、Luna Studio、およびエージェント制御の公式公開マイルストーンに従って分割されます。
主要ラインのマイルストーン
- 2024-10-15: 評価インテリジェンス プラットフォーム。シリーズ B の公式発表では、このプラットフォームが AI 開発ワークフローをカバーする評価インテリジェンスであると説明されています。製品コンポーネントには、Fine-Tune、Evaluate、Observe、Protect が含まれており、Luna Evaluation Suite が幻覚、検索の有効性、エージェントの品質、その他の要素を評価できることを強調しています。
- 2025-07-16: エージェント信頼性プラットフォーム。公式ブログでは、Graph Engine を使用してエージェントの観察を解決し、Insights Engine を使用して障害モードを自動的に分析し、Luna-2 を使用してリアルタイムのガードレールをサポートする、無料の Agent Reliability Platform を発表しました。
- 2026-05-22: ルナ スタジオ。リリースノートでは、企業顧客向けに Luna Studio をリリースします。これは、低遅延、低コストの SLM メトリクスをトレーニングするために使用され、評価予算を監視するために統合コストが追加されます。
- 2026-06-05: エージェント制御。リリース ノートでは、集中コントロール プレーンを使用してガードレールとガバナンス ポリシーを定義し、エージェント コードを変更せずに有害なコンテンツ プロンプト インジェクション、PII 漏洩、その他のリスクをブロックするエンタープライズ エージェント コントロールをリリースします。
検証のポイント
運用環境では、2026-06-05 Agent Control を最新のパブリック機能ノードと見なす必要がありますが、実際の可用性は、エンタープライズ権限、パッケージ、展開フォーム、販売アクティベーションによって影響を受ける可能性があります。 Luna メトリクスのページには、Luna メトリクスはリクエストに応じて顧客にのみ公開されるため、すべての Luna-2 メトリクスがデフォルトですべてのアカウントですぐに使用できるとは見なされないことも記載されています。
バージョン情報
- 企業顧客向けのエージェント制御 :公式リリース ノートでは、企業顧客向けにガードレールを一元的に定義し、エージェント ガバナンスを管理する Agent Control がリリースされました。エージェントコードを変更することなく、有害なコンテンツのプロンプト挿入、PII 漏洩、その他のリスクをブロックできます。
- Luna Studio と統合のコスト チャート :公式リリースノートでは、低遅延、低コストの SLM メトリクスをトレーニングするための Luna Studio エンタープライズ機能のリリースと、LLM-as-a-judge コストを追跡するための統合コスト管理ページの追加を発表しています。
- エージェント信頼性プラットフォーム :公式ブログでは、Graph Engine、Insights Engine、Luna-2 リアルタイム ガードレールを中心とした無料の Agent Reliability Platform を発表し、マルチエージェント システムの監視、障害モード分析、運用保護をサポートしています。
- 評価インテリジェンスプラットフォーム :公式ブログではシリーズBで4,500万米ドルの資金調達を発表し、主な製品ラインを評価インテリジェンスプラットフォームとして定義し、Fine-Tune、Evaluate、Observe、ProtectなどのAI品質ライフサイクルをカバーしました。
ユーザーレビュー