人工分析
Artificial Analysis は、
人工分析
コアパラメータと統計
| パラメータ | 公式の検証可能な情報 |
|---|---|
| 製品のポジショニング | 大手の独立系 AI ベンチマーク会社 |
| 評価用スピンドル | インテリジェンス、速度、タスクあたりのコスト、プロバイダーのパフォーマンス |
| プラットフォームの対象範囲 | 言語、コーディング エージェント、画像、ビデオ、音声、音楽 |
| データスケール | 500 以上のモデル、100 以上の推論プロバイダー、0B 以上の評価トークン (ページには継続的な成長指標が表示されます) |
| 自己調査の主要な指標 | 人工分析インテリジェンス インデックス、AA-ブリーフケース、AA-オムニサイエンス、GDPval-AA v2 |
| 商品化 | Pro は 1 シートあたり月額 417 ドル。エンタープライズカスタム |
| API 機能 | API とデータブックのダウンロードを提供 |
| 公約 | 独立性ポリシー、プロバイダーは結果や方法論の変更に対して料金を支払うことはできません。 |
簡単なコメント: Artificial Analysis の中心的な価値は、「誰が 1 位にランクされるか」ではなく、AI の選択において組み合わせるのが最も難しいコスト、スピード、品質、サプライヤーの違いを同じフレームワークに組み込むことです。
宣伝の検証: 公式は自らを独立したベンチマーク会社として位置づけています。このセールス ポイントは、スコアをリストするだけでなく、方法論、プロバイダーのパフォーマンス、価格設定のキャッシュ ルール、タスクごとの時間、ベンチマークの内訳も併せて開示しているため、通常のランキング サイトよりも説得力があります。
ユーザーと市場の認識
人工分析は一般消費者向けのツールではありません。モデルの調達、推論の選択、ベンチマークの比較、管理レポートを行う必要がある意思決定者を対象としています。価格ページには、Amazon、Google、IBM、Meta、Microsoft、Bloomberg、CNBC、Financial Times、BCG、McKinsey、Stanford HAI などによって公に参照されている多数のロゴが公開されています。これは単純にすべてが顧客であるという意味として理解することはできませんが、少なくともその図表と結論が業界およびメディアレベルで広く引用されていることを示しています。
もう 1 つの強力なシグナルは、プラットフォームのアップデートのペースです。 FAQ には、主要なモデルやプロバイダーは通常、リリース後 24 時間以内にベンチマークを完了すると記載されており、これによりベンチマークは 6 か月ごとに更新される調査レポートというよりも、リアルタイムのインテリジェンス システムに近いものになります。
コストメリット
| パッケージ | 公定価格 | コアコンテンツ |
|---|---|---|
| 無料/公開サイト | $0 | 公開リスト、方法論、いくつかのグラフ、変更履歴を表示 |
| プロ | $417/月/シート | データ、レポート、API、カスタム グラフ、電子メール サポートへのフル アクセス |
| エンタープライズ | カスタム | より高い API レート制限、カスタム ベンチマーク、ワークショップ、AI アドバイザリー、パーソナライズされたサポート |
無料の真実: トレンドを確認するには公開サイトで十分ですが、エクスポート、テーブル構築 API、業界レポート、サポートはすべて有料レベルにあるため、実際の購入価値は Pro および Enterprise です。
コスト削減と効率向上の定量化: モデルの選択を行うチームにとって、最も時間がかかるのは、ベンチマークを実行することではなく、「品質、速度、価格プロバイダーの違い、およびキャッシュ ルール」を意思決定の結論に要約することです。人工分析では、この種の調査を、数日または数週間にわたる手作業による収集から、同じプラットフォーム内で時間レベルのスクリーニングとエクスポートに圧縮します。これはプラットフォームのフォームに基づくプロセスの控除であり、正式な約束ではありません。
隠れたメリット/コスト: 間違った調達や間違ったモデルルートによって引き起こされる手戻りコストを削減できますが、チームがサードパーティの評価基準に依存することも増えます。実際のワークロードがベンチマーク構造と大きく異なる場合でも、リストに直接基づいて結論を導くのは間違いです。
主な機能
- インテリジェンス / スピード / コストのトリプル ビュー: モデルのインテリジェンス、出力速度、タスクあたりのコストを 1 つの座標系にまとめ、最初のモデル選択に適しています。
- プロバイダーのパフォーマンス: 同じモデルは、プロバイダーの次元に応じて出力速度、価格、およびキャッシュの価格設定を調べます。これは推論サプライヤーの選択に適しています。
- コーディング エージェント インデックス: Claude Code、Codex、Cursor Desktop、Gemini Desktop などのエージェントでエンドツーエンドのソフトウェア エンジニアリング ベンチマークを実施します。
- AA-Briefcase / GDPval-AA / AA-Omniscience: より実際のビジネスに近い、長期サイクルの知識労働、経済価値タスク、幻想と知識の信頼性などをカバーするベンチマーク。
- 画像/ビデオ/音声リーダーボード: 言語モデルだけに焦点を当てるのではなく、プラットフォームをマルチモダリティに拡張します。
エキスパートビュー: 人工分析の隠れたつながりは、「チャートはチャートそのものではない」ということです。コスト、速度キャッシュの価格設定、プロバイダー P50 の持続的なパフォーマンス、ベンチマーク手法が 1 つのシステムに統合されている場合、Excel スプレッドシートの作業を大幅に節約できます。
モデルとバージョンの進化
Artificial Analysis の進化は、従来のソフトウェア機能のボタンを押すだけのリリースではなく、「新しいインデックス + 新しいベンチマーク + 新しいプロバイダー データ レイヤー」の継続的な拡張です。
| マイルストーン | 日付 | 主な変更点 |
|---|---|---|
| 2026-07 プラットフォームのスナップショット | 2026-07-01 | モデルとプロバイダーのベンチマークを継続的に更新し、言語とマルチモーダルのリストを最新の状態に保ちます。 |
| インテリジェンス インデックス v4.1 | 2026-06-15 | このインデックスはエージェントのワークロードに偏り、タスクごとのメトリクスを強化します。 |
| AA-ブリーフケース | 2026-06-18 | 新しい成長サイクルの知識作業ベンチマーク |
| コーディング エージェントのベンチマーク | 2026-05-11 | オンラインコーディングエージェントの総合評価 |
| ITベンチ-AA | 2026-05-27 | SRE / Kubernetes インシデントの根本原因シナリオ ベンチマークの紹介 |
これは、「言語モデルのランキング作成」から「AI産業のインテリジェンスインフラストラクチャの作成」にまで拡大したことを示しています。新しいベンチマークを追加するという方向性も非常に明確で、単に一般的なテストのスコアを取得するのではなく、実際のワークフローにどんどん近づいています。
技術的な利点
主なタイプの判断: Artificial Analysis の主な提供形式は生産性/ビジネスサイド アプリケーションであり、コアとなる出力はベンチマーク インテリジェンスと意思決定サポートであり、基礎となるモデルやデータベース自体ではありません。
完全な評価項目: 多くのリストでは、どちらが優れているかしかわかりませんが、なぜ高価なのか、なぜ速いのか、なぜ大きく異なるのかについてはわかりません。人工分析はこれらの変数を明示的に分離します。
方法論の透明性の向上: このサイトでは、方法論、キャッシュの価格の内訳、P50 の持続的なパフォーマンス基準、およびさまざまなベンチマーク コンポーネントが直接公開されるため、単に結論を見るのではなく、結果をよりレビューしやすくなります。
購入決定に近づく: Pro では、写真を見るだけでなく、データ プレイグラウンド、テーブル ビルダー、データ エクスポート、API、業界レポートも利用できます。これらはすべて意思決定と報告のためのものであり、傍観者のためのものではありません。
人間と機械のコラボレーション境界: プラットフォームは、多数のベンチマーク集計、価格比較、チャートの生成を自動的に完了できますが、実際のサプライヤーの署名、ワークロードの再現、コンプライアンスのレビュー、および最終的な調達の決定は、独自のシナリオに従って内部チームによって依然としてレビューされる必要があります。リストは PoC に代わることはできません。
使い方
| 入口 | 適用対象 | 説明 |
|---|---|---|
| 公開ウェブページ | 開発者、研究者、投資家、プロダクト マネージャー | インテリジェンス、速度、コスト、プロバイダー、エージェント、マルチモーダル データを参照 |
| プロ | エクスポートと API を必要とする意思決定チーム | ローカル分析、内部レポート、システム アクセス用 |
| エンタープライズ | 大規模な組織、研究部門、インフラストラクチャ チーム | カスタム ベンチマーク、ワークショップ、AI アドバイザリーについて |
| API | 内部ツール、インテリジェンス パネル、データ プラットフォーム | プログラム可能なデータ ソースを取得する |
一般的な使用順序は、最初にパブリック ページでモデルの範囲を絞り込み、次にプロバイダーのパフォーマンスとタスクあたりのコストを確認し、最後に Pro を使用してデータまたは API をエクスポートして内部ダッシュボードに接続することです。調達チームやプラットフォーム チームにとって、これはドキュメントや価格ページを手動で検索するよりもはるかに効率的です。
製品の価格設定
| パッケージ | 価格 | 適応シナリオ |
|---|---|---|
| パブリックアクセス | $0 | リストを表示し、方法論を表示し、変更ログを追跡します。 |
| プロ | $417/月/シート | シングルシート ユーザーにはフル アクセス、API、エクスポート、レポートが必要 |
| エンタープライズ | カスタム | 大規模なチーム、再配布、カスタム ベンチマーク、コンサルティング サービス |
もう一つの重要な点は、関係者が「無料体験はしない」と明言していることだ。これは、ボリュームを増やすために低しきい値のトライアルに依存せず、プロフェッショナルなインテリジェンス製品としてそれ自体を販売していることを意味します。
アプリケーションのシナリオ
- モデルとプロバイダーの選択: 異なるプロバイダーで同じモデルの価格、速度、持続的なパフォーマンスを比較し、推論スタックの調達に適しています。
- 経営および投資調査: AI 市場のトレンド、主要モデル、コスト削減率、サプライヤーの競争環境に関する意思決定のブリーフィングを作成します。
- エージェントとマルチモーダル ルートの判断: コーディング エージェント インデックス、AA-ブリーフケース、および音声/画像/ビデオのリストを使用して、プレーン テキストのテスト スコアだけを確認するのではなく、実際のワークフロー機能を確認します。
次元削減攻撃シナリオ: ランキングを見るだけの一般ユーザーではなく、「どのモデルを使用するべきか、どのプロバイダを使用するべきか、コストとリスクはどこにあるのか」を短時間で答えたいチームに最適です。
該当する人
- AI プラットフォーム チームおよびアーキテクチャ リーダーに適しています: 特にモデルの選択を明確に説明する必要があるリーダーに適しています。
- 研究、投資、コンサルティング、業界分析の職に適しています: 単一の視点ではなく、継続的に更新されるデータ ベースラインを提供するためです。
- 予算は大きいが意思決定エラーによるコストが高い組織に適しています: このタイプのユーザーにとっては、高単価のサブスクリプションが合理的です。
境界線には適していません: あなたが単なる個人開発者で、試してみるモデルを時々選択する場合は、通常は公開ページで十分です。 Proの価格はライトユーザーにとって明らかに高すぎます。
概要と展望
Artificial Analysis の希少性は、「ランキング リストもある」ということではなく、リスト、価格プロバイダー、エージェントのベンチマーク、および方法論を統合した意思決定システムに統合していることです。実際に AI の選択を行っている人にとって、これは別の「トップ 10 モデルの推奨事項」を読むよりもはるかに価値があります。
その調達・採用リスクは主に3点あります。まず、価格が高く、ライトユーザーにとってコストパフォーマンスが良くありません。第 2 に、サードパーティのベンチマークにはワークロードの偏差があり、独自の PoC を直接置き換えることはできません。第三に、外部のインテリジェンス プラットフォームに依存するほど、内部のビジネス上の制約が完全にマッピングされているかどうかに注意を払う必要があります。それを意思決定の代替手段としてではなく、意思決定の加速手段として扱うことが、それを開くための正しい方法です。
バージョン情報
- 人工分析プラットフォームのスナップショット 2026-07 :現在のパブリック プラットフォームは、インテリジェンス、速度、タスクあたりのコスト、API プロバイダーのパフォーマンス、コーディング エージェント、画像/ビデオ/音声のリーダーボードをカバーしており、2026 年 7 月 1 日に最新のモデルとプロバイダーのベンチマーク結果を更新し続けます。
- 人工分析インテリジェンス インデックス v4.1 :インテリジェンス インデックス v4.1 では、評価の焦点がエージェント ワークロードにさらに移され、GDPval-AA v2、τ³-Banking、ターミナルベンチ v2.1、およびタスクごとのメトリクスが更新されます。
- AA-ブリーフケースの発売 :ルーブリック、分析品質、プレゼンテーション品質を使用してエージェントのナレッジ ワークを評価する、長期的なナレッジ ワーク用の AA-Briefcase を開始しました。
- ITBench-AA の発売 :SRE シナリオ用の ITBench-AA を開始し、Kubernetes インシデント対応タスクを使用してエージェントのエンタープライズ IT 機能をテストしました。
ユーザーレビュー