アライズフェニックス
無料
Arize Phoenix は、Arize AI が立ち上げたオープンソースの AI 可観測性プラットフォームです。 LLM/エージェントのトレース、OpenTelemetry コレクション、裁判官としての LLM 評価、データ セット、実験的プレイグラウンド、およびプロンプト管理をカバーしています。開発チームが AI アプリケーションをローカル、コンテナ Kubernetes または Phoenix Cloud でデバッグおよび改善するのに適しています。
ツールテキスト
コアパラメータと統計
Arize Phoenix は、AI エンジニアリング チーム向けのオープンソースの可観測性および評価プラットフォームです。主な目標は、モデル自体を置き換えることではなく、LLM、RAG、エージェント、プロンプトの反復プロセス中に実行中の証拠を収集することです。リクエストのリンク スパン、トークンとコスト、取得コンテキスト、評価結果、データ セットのバージョン、および実験結果をすべて同じシステムで観察できます。公式 GitHub README では、Phoenix をオープンソースの AI 可観測性プラットフォームとして位置づけており、実験、評価、トラブルシューティングをカバーしています。
| プロジェクト | 広報 | |
|---|---|---|
| 製品名 | アライズフェニックス | |
| 正式な入口 | phoenix.arize.com | |
| 書類入口 | arize.com/docs/phoenix | |
| GitHub リポジトリ | Arize-ai/phoenix | |
| PyPI パッケージ | arize-phoenix | |
| 現在のバージョン | 17.9.0、2026 年 6 月 19 日にリリース | |
| ライセンス | エラスティックライセンス 2.0;公式ドキュメントでは、セルフホスティングは無料であり、機能的なしきい値がないことが説明されています。 | |
| 導入フォーム | ローカル Jupyter ノートブック、Docker、Kubernetes/Helm、Phoenix Cloud/Arize AX | |
| コアコンピテンシー | トレース、評価、データセット、実験、プレイグラウンド、プロンプト管理、PXI | |
| 遵守基準 | OpenTelemetry / OpenInference に基づくトレースおよび自動追跡エコシステム | |
| 言語と統合 | Python、JavaScript/TypeScript SDK。 OpenAI、Anthropic、Google、Bedrock、LangChain、LlamaIndex、DSPy、CrewAI およびその他のエコシステムをサポート | |
| コミュニティの規模 | GitHub 約 10.2k スター、約 936 フォーク。最新の PyPI パッケージには Python >=3.10、<3.15 | が必要です。 |
これらのパラメータは、Phoenix が単純なログ プラットフォームではなく、「AI アプリケーションのデバッグおよび評価ワークベンチ」に近いことを示しています。観察、評価、実験を結び付けます。トレースで遅延が長い、取得が不十分、または幻覚のリスクが示された場合、チームは対応するプロンプト、データセットのサンプル、および実験結果を追跡し続けて、再現可能なプロジェクト記録を形成できます。
ユーザーと市場の認識
フェニックスの市場認識は主に 3 種類のシグナルから得られます。 1 つ目は、オープンソース開発者による採用です。GitHub 上の 10,000 を超えるスターの規模は、GitHub がもはや初期のコンセプトのウェアハウスではなく、継続的に注目され、LLM 可観測性の分野で使用されているインフラストラクチャ プロジェクトであることを示しています。 2 つ目はパッケージとイメージの配布です。公式は PyPI パッケージ、Docker イメージの Python サブパッケージ、TypeScript パッケージを同時に保守しており、使用シナリオがノートブック プロトタイプ、サーバー アプリケーション、コンテナ化された展開、フロントエンド/ノード ツール チェーンをカバーしていることを示しています。 3 つ目は Arize の商業的取り組みです。Phoenix は無料でセルフホストすることも、Phoenix Cloud/Arize AX を通じてホストされたバージョンを使用することもでき、個々の開発者や企業チームに異なる実装パスを残すことができます。
Phoenix の公式ページが提供する生態学的シグナルには、月間ダウンロード数 300 万件以上、GitHub スター数 10,000 件以上、コミュニティ数 7,000 件以上、OpenTelemetry インストルメンテーションの月間ダウンロード数 2,200 万件以上が含まれます。これらの数字は、企業顧客の数や収益データよりも、人気やエコ活動の参考として適しています。実際の購入は、チームのトレース サイズ、データ保持要件、コンプライアンス要件、セルフホスティング機能に基づいて判断する必要があります。
ユーザー ポートレートの観点から見ると、AI エージェントと RAG アプリケーションの成長後、Phoenix の価値はさらに高まるでしょう。単純なチャット デモの場合、トラブルシューティングのためにログを印刷するだけで済みます。システムに検索、ツールの呼び出し、マルチエージェントのコラボレーション、ユーザーセッション、自動評価が含まれるようになると、従来のログでは「どのステップが品質低下の原因となったか」に答えるのは困難になります。 Phoenix の価値は、開発、評価、製品、プラットフォームの各チームが同じトレースに基づいて議論できるように、これらの運用証拠を構造化することにあります。
コストメリット
Phoenix の中核となるコスト上の利点は、「無料のセルフホスト型オープンソース + オンデマンドのマネージド クラウド」です。セルフホスティングの公式ドキュメントには、次のように明確に記載されています。独自のインフラストラクチャまたはクラウド アカウントでのセルフホスティング Phoenix は無料で、ライセンス料はなく、使用制限や機能のしきい値はなく、データは Arize に送信されません。これは、機密性の高いビジネス データを扱うチーム、保存期間を制御したいチーム、またはイントラネット展開を必要とするチームにとって重要です。
| ソリューション | コスト構造 | チームフィット | 主なトレードオフ |
|---|---|---|---|
| ローカル / ノートブック | ソフトウェア自体は無料で、コストは主にローカル リソースとデバッグ時間です。個々の開発者向けの PoC、教育、および迅速なトラブルシューティング | 複数人による長期的な共同作業や本番環境の保持には適さない | |
| Docker / 構成 | ソフトウェアは無料で、サーバー、ストレージ、バックアップ、運用および保守のコストをカバーします。小規模チーム、社内パイロット、軽生産 | アップグレードとセキュリティ構成を自分で維持する必要がある | |
| Kubernetes / ヘルム | ソフトウェアは無料ですが、コストはクラスター、オブジェクト ストレージ、データベース、モニタリング、SRE から発生します。プラットフォーム チーム、データ重視の企業 | 運用と保守の複雑さは増すが、ガバナンス機能はより強力 | |
| フェニックス クラウド / アライズ AX 無料 | 公式価格ページには、無料は 25,000 スパン トレース/月、1 GB、15 日間の保持を含む単一開発者向けであることが示されています。すぐに始めたいがインフラストラクチャを展開したくない個人または小規模チーム | 無料の割り当てと保存期間には制限があります | |
| アライズAXプロ | 公式価格ページには、Pro が小規模チーム/スタートアップ チーム向けで、月あたり 50,000 スパン トレース、10 GB、30 日間の保持が含まれ、追加の使用をサポートしていることが示されています。ホスティング サービスとチームのコラボレーションが必要 | スパンとデータ量に応じてコストが増加 | |
| AXエンタープライズ | SLA、SOC2/HIPAA、トレーニング、自己ホスト型アドオンなどのサポートを強調したカスタマイズされた見積もり | 強力な SLA コンプライアンスとエンタープライズ調達プロセスを備えた組織 | 営業連絡と契約確認が必要 |
Phoenix のセルフホステッド パスは、ホステッド SaaS のみを提供する可観測性ツールと比較して、ベンダー ロックインのリスクを大幅に軽減します。本当の総コストは消えるわけではありませんが、ソフトウェア ライセンスからインフラストラクチャ、データ保持、アクセス制御、バックアップ リカバリ、アップグレード プロセスへと移行します。強力なエンジニアリング能力、データの機密性、または既存の Kubernetes プラットフォームを備えたチームの場合、通常、このコスト構造はより制御可能です。運用やメンテナンスの機能がない小規模チームの場合は、ホスト型バージョンの方が安心です。
主な機能
- トレース: OpenTelemetry/OpenInference を通じて LLM アプリケーションのランタイム リンクを収集し、トレース、スパン、遅延トークン、コスト、入力と出力、取得結果およびツール呼び出しを表示します。これは、RAG、エージェント、およびワークフローの品質とパフォーマンスの問題のトラブルシューティングに適しています。
- 評価: 応答評価、取得評価、裁判官としての LLM などの評価モードをサポートし、幻覚、QA の正しさ、関連性、およびその他の指標を追跡または実験結果に添付して、チームが「気分が良くない」を比較可能な指標に変換するのに役立ちます。
- データセット: 回帰テスト、評価の微調整、またはプロンプト比較用にバージョン管理されたサンプル セットを作成し、プロンプト変更のたびに手動によるスポット チェックのみに依存するリスクを軽減します。
- 実験: プロンプト、モデル、取得構成、パラメーター、コードの変更によって引き起こされる効果の違いを追跡します。オンラインにする前に複数の計画を比較するのに適しています。
- プレイグラウンド: プロンプトを最適化し、モデルを比較し、パラメーターを調整し、トレースされた LLM 呼び出しを再生します。これは、実際の障害サンプルからデバッグ インターフェイスに戻るのに適しています。
- プロンプト管理: プロンプトのバージョン管理、タグ管理、体系的なテストを実行して、プロンプトの変更をコード変更と同様に記録してロールバックできるようにします。
- PXI / Phoenix Intelligence: 公式 README では、トレースのデバッグ、プロンプトの反復、製品内でのナビゲーションを行うための組み込み AI エンジニアリング エージェントとして説明されており、新しいメンバーがトレースを理解するための敷居を下げるのに適しています。
- MCP および CLI エコシステム: 正式にリストされている
@arizeai/phoenix-mcpおよび@arizeai/phoenix-cliは、Phoenix の機能を開発コンテキストやエージェント ワークフロー (カーソル コードやクロード コードなど) に接続するために使用されます。
これらの機能を組み合わせることで、フェニックスは単に「ログを読む」だけでなく、観測データを実験や評価に直接結び付けることが可能になります。 AI 製品の場合、最も難しいことは、多くの場合、エラーを確認することではなく、エラーが再現可能かどうか、新しいプロンプトによって修正されるかどうか、他のサンプルに悪影響を与えるかどうかを知ることです。 Phoenix はこの問題を中心に設計されています。
モデルとバージョンの進化
Phoenix 自体は基本モデルではなく、AI アプリケーションの可観測性および評価プラットフォームです。ここでのバージョンの進化とは、「arize-phoenix」パッケージとプラットフォーム機能の反復を指します。 PyPI のリリース履歴によると、Phoenix は 2026 年も高頻度リリースを維持しており、17.9.0 は 2026 年 6 月 19 日にアップロードされ、17.8.1 と 17.8.0 は両方とも 2026 年 6 月 17 日にリリースされ、17.7.0 は 2026 年 6 月 16 日にリリースされました。
| 時間 | バージョン | 公共信号 |
|---|---|---|
| 2026-06-19 | 17.9.0 | GitHub リリースは最新としてマークされています。 PyPI はホイールとソースの配布を同時に提供します |
| 2026-06-17 | 17.8.1 | 17.8 メインライン メンテナンス リリース |
| 2026-06-17 | 17.8.0 | 17.x メインライン機能リリース |
| 2026-06-16 | 17.7.0 | 17.x メインライン機能リリース |
| 2026-06-02 | 17.0.0 | 17.x はメジャー バージョンの開始点の 1 つであり、プラットフォームが依然として急速に進化していることを示しています。 |
エンジニアリング採用の観点から見ると、高頻度バージョンの反復には 2 つの側面があります。一方で、フェニックスが急速に変化する LLM/エージェント エコシステムに積極的に対応し、新しいフレームワーク、新しいプロバイダー、評価ワークフローを迅速にフォローアップできることを示しています。一方、運用展開では、特にセルフホスト型のシナリオでは、バージョンの修正、アップグレードの検証、およびデータ移行のプロセスを確立する必要があり、各小さなバージョンを直接追跡して自動的にアップグレードすることは適切ではありません。
技術的な利点
Phoenix の最初の技術的利点は、まず OpenTelemetry であることです。 LLM 可観測性 プライベート埋め込みポイント形式を使用すると、短期的にはグラフを迅速に作成できますが、長期的にはデータを 1 つのツールにロックするのは簡単です。 Phoenix の OTel/OpenInference ベースのルートにより、トレース データが言語、フレームワーク、サービスを超えて流れることが容易になり、企業が既存の監視可能なパイプラインにアクセスすることも容易になります。
2つ目のメリットは「traceとevalが同じ画面上にある」ということです。多くのシステムは呼び出しチェーンを記録できますが、このリンクが良好かどうかを説明することはできません。他の評価ツールでもポイントを与えることはできますが、特定の検索ドキュメント プロンプト、モデル パラメーター、およびツール呼び出しを追跡できない場合があります。 Phoenix は評価結果をトレースに添付し、失敗した回答を取得したフラグメント スパンまで追跡し、結果を判定することができます。
3 番目の利点は実験的なものです。データセット、実験、プレイグラウンド、プロンプト管理により、フェニックスは問題の発見から解決策の比較までのプロセスをカバーできます。チームは、チャット ウィンドウで何度も試行するのではなく、オンラインの失敗サンプルをデータ セットに蓄積し、さまざまなプロンプト、モデル、または取得構成のインジケーターの変化を比較できます。
4 番目の利点は、展開の弾力性です。公式 README では、Phoenix はローカル マシン、Jupyter ノートブック、コンテナ化された展開、またはクラウドで実行できると説明しています。セルフホスティング ドキュメントでは、Docker、Kubernetes/Helm などへのパスも明確にしています。この柔軟性により、Phoenix は個人的なデバッグの両方に対応し、徐々に企業の内部プラットフォームに参入することができます。
使い方
通常、Phoenix の使用パスは、軽いものから重いものまで 3 つのステップに分かれています。最初にローカルで実行し、次にトレースに接続し、最後に評価および実験プロセスを確立します。
| 入口 | アクションに最適 | 説明 |
|---|---|---|
PyPI アリゼフェニックス |
デバッグとクイックトライアルのためにノートブックをローカルにインストールします。 pip install arize-phoenix で Phoenix を起動します。 |
|
| ドッカー | ローカルまたはサーバーの展開 | チーム共有インスタンスまたは軽量の実稼働検証に適しています。 |
| Kubernetes / ヘルム | 本番環境、セルフホスティング、プラットフォーム | 既存の K8s プラットフォームとコンプライアンス要件を持つチームに最適 |
| フェニックスクラウド / アライズAX | ホスト型の使用 | インフラストラクチャを維持したくないチーム向け |
| SDK / OTEL エンドポイント | アプリケーション トレースにアクセスする | Python/JS アプリケーション LLM フレームワークまたはエージェント ランタイムのスパンを Phoenix に送信する |
一般的な開始プロセスは次のとおりです。
- 導入方法を選択します。個人のトライアルはローカルまたは Phoenix Cloud で開始でき、企業の PoC は Docker を使用でき、Kubernetes/Helm を評価するには実稼働セルフホスティングが推奨されます。
- OpenInference/OpenTelemetry 計測器をアプリケーションに接続します (OpenAI、Anthropic、LangChain、LlamaIndex、CrewAI、DSPy、その他の統合など)。
- Phoenix でトレースを表示し、まずスパン レベル、入力と出力、取得ドキュメント トークン、および遅延が完了しているかどうかを確認します。
- 検索の関連性、回答の正しさ、幻覚、フォーマットへの準拠、カスタム指標などの重要なタスクの評価を構築します。
- 失敗したサンプルをデータセットに取り込み、実験を使用してさまざまなプロンプト、モデル、パラメーター、および取得戦略を比較します。
- オンラインにする前にバージョンと展開構成を修正し、アクセス制御、データ保持、バックアップ、アップグレード、機密データ処理ポリシーを確認します。
製品の価格設定
フェニックスの価格設定では、ソース ホスティング サービスと Arize ホスティング サービスを区別する必要があります。オープンソースの Phoenix はセルフホストが無料です。公式ライセンス文書には、Elastic License 2.0 に基づいており、独自のインフラストラクチャまたはクラウド アカウントで無料のセルフホスティングが可能であり、機能のしきい値はないと記載されています。言い換えれば、チームがインフラストラクチャと運用保守を自ら担当する場合、Phoenix Ontology はシート、スパン、または機能モジュールごとに料金を請求しません。
ホスティング サービスに関しては、Arize の価格ページでは Phoenix が Arize AX システムに分類されています。Free は 1 人の開発者向け、Pro は小規模チームおよびスタートアップ チーム向け、Enterprise はカスタマイズされたプラン向けです。公開ページには、無料版には月あたり 25,000 スパン トレース、15 日間の 1 GB のデータ保持が含まれていることが示されています。 Pro には、月あたり 50,000 スパン トレース、10 GB、30 日間の保持が含まれており、追加のスパンと GB の請求が行われます。 Enterprise はカスタムであり、SLA、SOC2/HIPAA、トレーニング、自己ホスト型アドオン、データ常駐などのエンタープライズ機能の独占的なサポートに重点を置いています。
実際に選ぶ際には、定価だけを比較するのはおすすめできません。 AI 可観測性のコストは、トレースの粒度、コンテキストの長さ、取得したドキュメントのサイズ、保存期間、チームの規模、コンプライアンス要件に強く関連しています。 PoC フェーズは、無料のセルフホスティングまたは無料のクラウドから開始できます。本番環境に入ると、ストレージの増加、クエリのパフォーマンス、アクセス制御、マスキング ポリシー、およびアップグレードのメンテナンスが予算に含まれる必要があります。
アプリケーションのシナリオ
- RAG アプリケーション品質のトラブルシューティング: ユーザーの質問を記録し、ドキュメントの再ランク付け結果を取得し、回答と評価スコアを生成し、取得漏れ、不明瞭なコンテキストフリー プロンプト、またはモデル推論の失敗によるエラーを迅速に特定します。
- AI エージェントとツール呼び出しのデバッグ: 複数ステップのツール呼び出しエージェントの決定、遅延、トークン、障害ステータスをトレース グラフに拡張します。これは、長いリンク エージェントのスタック ポイントのトラブルシューティングに適しています。
- プロンプト回帰テスト: 実際の障害サンプルをデータセットに追加し、実験で新しいプロンプトと古いプロンプト、さまざまなモデルとパラメーターの組み合わせを比較して、プロンプトの反復によって引き起こされる回帰リスクを軽減します。
- LLM 製品の発売前評価: 応答評価と取得評価を使用して発売のしきい値を確立し、製品、アルゴリズム、エンジニアリング チームが同じ指標セットを中心にリリースできるかどうかを議論できるようにします。
- エンタープライズ社内 AI プラットフォーム ガバナンス: 自己ホスト型の Phoenix で、各ビジネス チームの観測仕様を統一しながら、イントラネットまたは自己所有のクラウドにトレースと評価を残します。
- 開発者のローカル デバッグ: ノートブックまたはローカル サービスで Phoenix をすばやく起動し、呼び出しチェーンと評価結果を表示します。分散したログよりも簡単に確認できます。
これらのシナリオに共通するのは、単一の出力ではシステムが信頼できるかどうかを示すことができず、入力、コンテキスト、実行リンク、評価、およびバージョンの関係を保存する必要があることです。フェニックスは、「証拠の連鎖」を必要とするこの種の作業で最も価値があります。
該当する人
- LLM アプリケーション開発者: 最終的な答えを得るだけでなく、モデル、ツール、取得、通話中のプロンプトの特定の動作を確認する必要があります。
- RAG/エージェントエンジニアリングチーム: システムリンクが長く、障害の原因は検索、リランク、ツール呼び出し、計画、最終回答のいずれかで発生する可能性があります。
- AI プラットフォーム チーム: 組織内のトレース、評価、データセット、実験を統合し、各ビジネス チームの観察ツールの重複を削減したいと考えています。
- データ サイエンスおよび評価チーム: 人工サンプル LLM-as-a-judge、実験指標、オンライン トレースをリンクする必要があります。
- コンプライアンスまたはデータに敏感な企業: データの常駐、アクセス制御、保持期間、監査境界を自己ホストして制御したいと考えています。
適さない状況も明らかです。1 回限りのデモ、頻度の低い内部スクリプト、複数ステップのリンクのない単純なチャット ページの場合、Phoenix のコンセプトと導入コストは高額になる可能性があります。もう 1 つの境界は、運用と保守の機能です。セルフホスティングは無料ですが、運用環境での使用にはデータベース、ストレージ、バックアップ、権限、アップグレード、監視の保守が必要です。プラットフォーム機能を持たない小規模チームは、Phoenix Cloud または Arize AX から始めるのが適している可能性があります。
概要と展望
Arize Phoenix のコアコンピテンシーは、AI アプリケーションの「問題の発見」と「修正の証明」を結び付けることです。トレースにより、チームは出力がどのように生成されるかを知ることができ、評価により、結果が標準を満たしているかどうかをチームに知ることができ、データセットと実験により、チームは特定の変更が本当にシステムを改善するかどうかを知ることができます。迅速に反復する LLM、RAG、エージェント アプリケーションの場合、このクロージャーは単純なログや人間による 1 人のレビューよりも信頼性が高くなります。
現時点で注意する必要がある主な制限が 3 つあります。まず、Phoenix はオープンソースで無料のセルフホストですが、ライセンスは Elastic License 2.0 であり、Apache/MIT などのルースライセンスと同等ではありません。商用再配布およびホスティングパッケージには法的確認が必要です。 2 番目に、高頻度のリリースでは、運用チームがバージョン修正とアップグレード テストを行う必要があります。第三に、フェニックスの有効性は埋められたポイントの品質に依存します。トレース構造、入出力の感度低下、または評価サンプルの設計が適切でない場合、インターフェイスがどれほど優れていても、不完全な証拠しか提示できません。
今後も 3 つの点で Phoenix の進歩を観察し続ける価値があります。1 つは、OpenInference/OTel エコシステムがより多くのエージェント フレームワークをカバーしていることです。第二に、PXI、MCP、CLI などの AI エンジニアリング エージェントが「トレースの表示」をさらに「自動位置決めと推奨修理」に変えることができるかどうか。 3 つ目は、個人、オープンソース チーム、企業がデータ ガバナンスとコスト要件に基づいて適切な道を選択できるように、Arize AX とオープンソース Phoenix の間の境界が明確なままであるかどうかです。
関連ツール: hugging-face、replicate
バージョン情報
- アライズフェニックス v17.9.0 :GitHub リリースと PyPI の両方で、最新の arise-phoenix バージョンが表示されます。 PyPI パッケージの概要は AI Observability and Evaluation で、ライセンスには Elastic-2.0 というラベルが付いています。
- アライズフェニックス v17.8.1 :17.x メインライン メンテナンス リリース。17.8.0 の直後にリリースされました。
- アライズフェニックス v17.8.0 :17.x メインライン機能バージョン。Phoenix プラットフォーム機能の継続的な反復に使用されます。
- アライズフェニックス v17.7.0 :17.x メインライン機能リリース。2026 年 6 月の高いリリース頻度でリリースされます。
ユーザーレビュー