アリーナ
無料
Arena (旧 LMArena / LMSYS Chatbot Arena) は、カリフォルニア大学バークレー校の研究チームによって立ち上げられたコミュニティ主導の AI レビュー プラットフォームです。バトル モードとコミュニティ投票メカニズムを通じて、ユーザーは実際のシナリオでさまざまなモデルの出力品質を比較し、8,200 万を超える実際の人間の好みに基づいて公開ランキングを形成できます。テキスト、コード、画像、ビデオ エージェントなどのマルチモーダルな評価次元をカバーし、企業やモデル研究所向けの商用評価サービスも提供します。
アリーナ
アリーナのコアパラメータと統計
Arena (旧 LMArena / LMSYS Chatbot Arena) は、カリフォルニア大学バークレー校の研究チームによって設立されたコミュニティ主導の AI 評価プラットフォームです。公式には「現実世界での AI パフォーマンスを理解するためのコミュニティ主導のプラットフォーム」と位置付けられています。これは AI 対話アシスタントでもモデル トレーニング フレームワークでもありませんが、「モデル作成者」と「モデル消費者」を結び付ける評価インフラストラクチャです。8,200 万を超える実際の人間の投票を通じて、テキスト、コード、画像、ビデオ エージェントなどのマルチモーダルな側面をカバーする公開ランキングを形成します。
| プロジェクト | 広報 | |
|---|---|---|
| 公式の位置づけ | コミュニティ主導の AI 評価プラットフォーム | |
| 前任者 | LMSYS チャットボット アリーナ → LMArena (2025) → アリーナ (2026) | |
| 評価次元 | テキスト、コード(WebDev/Image-to-WebDev)、画像生成・編集、ビデオ生成・編集 ビジョン、ドキュメント、検索、エージェント | |
| コミュニティの規模 | 1,000 万 + 月間アクティブ訪問者 7 億 + 会話 8,200 万 + 投票 | |
| ビジネスモデル | 無料のコミュニティ層 + エンタープライズ評価サービス (AI 評価) | |
| 資金調達状況 | 1 億ドルのシード (2025.05) → 1 億 5,000 万ドルのシリーズ A (2026.01) | |
| 年間収益 | 1 億ドルの ARR (2026 年 6 月現在、エンタープライズ サービスは 8 か月間オンラインになっています) | |
| 所属場所 | 米国 (カリフォルニア州バークレー) | エクスペディア |
| サポートプラットフォーム | ウェブ |
簡単なコメント: Arena は本質的に「AI モデル評価フィールド」です。ユーザーがモデルを選択したりチャットしたりすることはできませんが、バトル モードとコミュニティ投票を通じて、「どのモデルが優れているか」を主観的な印象から定量化可能なコミュニティのコンセンサスに変えます。
中心的なメカニズム: ユーザーがプロンプトの単語を入力すると、システムは 2 つのモデルの出力を匿名で表示し、ユーザーは自身の判断に基づいてより良い回答に投票します。投票結果は公開ランキングを推進し、オープンソースのデータセットは学術研究や産業研究に利用できます。このメカニズムにより、評価結果は静的なベンチマークのオーバーフィッティング指標ではなく、実際の人間の好みに近づきます。
収益構造: Arena は、エンタープライズ評価サービスの開始からわずか 8 か月後の 2026 年 6 月に、年間収益 1 億ドルを達成する予定です。成長は主に Model Lab のカスタム評価サービスと企業顧客向けの選択サポートによってもたらされました。1 億 5,000 万ドルのシリーズ A は Felicis と UC Investments が共同主導し、a16z、Kleiner Perkins、Lightspeed などが参加しました。
Arena のユーザーと市場での認知度
Arena の市場認知度は、コミュニティ側でのデータ スケール効果と企業側での商用検証という 2 つの明確な道筋から生まれています。
コミュニティ側のデータ密度: 公式開示によると、プラットフォームには合計 7 億 + 8,200 万の会話 + 1,000 万 + 月間アクティブ訪問者がいます。これらの数値の重要性は、トラフィックそのものではなく、「人間の好みのデータ」の不足にあります。モデルのレビューの大部分は静的なベンチマークまたは LLM を判断者として依存していますが、Arena は未解決のタスクについて実際のユーザーの判断を保持しています。 Arena は、HuggingFace 上の最大の人間の嗜好データセット (lmarena-ai) をオープンソース化しており、複数のモデリング研究所や学術機関から引用されています。
エンタープライズ側の成長曲線: エンタープライズ評価サービスは、開始から 8 か月後に ARR 1 億ドルに達しました。これは、モデル研究所や大企業が「実際の人間のフィードバックに基づく独立した透明な評価」に対する厳しい要求を持っていることを示しています。オープン ソース モデルとクローズド ソース モデルの両方を対象として、400 以上の新しいモデルが Arena を通じて公的に評価されています。エージェント モードは、開始から 1 か月以内に月間インタラクション ラウンド数が 500 万回以上に達し、前週比 10% 増加しました。これは、複数段階のエージェント評価が現在の市場で最も差し迫ったギャップの 1 つであることを証明しています。
学術的な影響: Arena チームは、ICML 2024 (Chatbot Arena 論文)、NeurIPS 2023 (LLM-as-a-judge)、ICLR 2025 (RouteLLM)、ICML 2025 (Prompt-to-Leaderboard、Arena-Hard) などのトップカンファレンスで評価方法に関する論文を発表しており、そのランキング方法はコミュニティの事実上の標準の 1 つとなっています。
前提条件: 評価プラットフォームの信頼性は、投票サンプルの多様性、プロンプトワードの中立性、およびランキング方法の統計的厳密さに基づいています。プラットフォーム ユーザーは主に技術者であり (X/Discord コミュニティが活発です)、サンプルは特定の使用シナリオに偏っている可能性があります。これは、ランキングを解釈する際に考慮する必要がある要素です。
アリーナのコスト上の利点
- C-side/Individual: 通常、コア機能を体験するために無料版が提供され、高頻度で使用するには有料パッケージのサブスクリプションが必要です。
- API/開発者: 通話量に応じて請求され、独自のシステムに柔軟に統合できる開発チームに適しています。
- エンタープライズ/民営化: カスタマイズされた見積もりと展開計画についてはビジネス オーナーにお問い合わせください。具体的な価格は、公式のリアルタイム価格ページに準拠します。
アリーナの主な機能
Arena の機能は「チャット ボックスとランキング リスト」ではなく、「評価、ルーティング、ランキング データのフィードバック」を中心に構築された包括的なシステムです。
-
戦闘モード (匿名モデルの比較): ユーザーがプロンプトの単語を入力し、2 つの匿名モデルがそれを同時に出力し、ユーザーが投票してより良い答えを選択します。これは、Arena の中核となるデータ収集メカニズムです。重要な設計は、ブランドの偏見を排除する匿名性、ランキングのノイズを減らすためのランダムなペアリング、そして ELO スコアリング システムが長期にわたって安定したランキングを提供することです。 隠されたリンク: 各投票は、ランキングの更新、Max ルーティング モデルのトレーニング、オープンソース データ セットの拡張という 3 つの値を同時に生成します。データ収集、ルーティングの最適化、コミュニティへの貢献という 3 つのタスクを 1 回の操作で完了します。
-
多次元ランキング システム: 単なる「全体的なランキング」ではなく、機能とモードに応じて 13 以上の細分化されたランキングに分かれています: 全体、エージェント、テキスト、WebDev、画像から WebDev、テキストから画像、画像編集、テキストからビデオへ、画像からビデオへ、ビデオ編集、ビジョン、ドキュメント、検索など。 エキスパート ビュー: セグメンテーション リストの価値は混乱を排除することです。全体で上位にランクされるモデルは、 WebDev シナリオではパフォーマンスが平凡です。セグメンテーション リストにより、選択内容が「最適なモデルの選択」から「このタスクに最適なモデルの選択」に変わります。
-
Max Model Router: コミュニティの 500 万件以上の投票データに基づいてトレーニングされたインテリジェントなルーティング エンジンで、ユーザーのヒントを最も適切なモデルに自動的に配布します。 エンジニアリングへの影響: Max は本質的に、人間の好みのトレーニングに基づいた「モデル推奨システム」です。その存在は、Arena が評価プラットフォームであるだけでなく、徐々にモデルのスケジューリングの意思決定層になりつつあることを意味します。
-
エージェント モード (複数ステップのタスク評価): 2026 年 6 月に開始された新しい評価モードで、エージェント シナリオの客観的なタスク完了率と幻覚率を測定します。従来の静的ベンチマークとは異なり、エージェント モードでは、オープン コンテキストでマルチステップ推論とツール呼び出しを実行するモデルの能力を評価します。発売後 1 か月以内に月間インタラクション数が 500 万件以上に達し、エージェント評価に対する市場の需要が予想をはるかに上回っていることを示しています。
-
エンタープライズ評価サービス (AI 評価): リリース前のモデル検証、競合製品の比較、および詳細な機能分析をカバーする、モデル研究所および企業向けにカスタマイズされた評価を提供します。 核となる価値: 内部評価チームは、サンプル サイズが不十分で評価項目が固定されているという問題に直面することがよくあります。 Arena のエンタープライズ サービスは、実際の人間の投票プールにアクセスすることで、これら 2 つのボトルネックを解決します。
Arena のモデルとバージョンの進化
Arena は AI モデルそのものではないため、そのバージョンの進化はプラットフォーム機能レイヤーの継続的な拡張に反映されます。
- 2025.09 エンタープライズ評価サービス開始: 純粋なコミュニティ プロジェクトから正式に商用化段階に入り、AI Evavals のカスタマイズされた評価サービスを開始します。
- 2025.11 Arena Expert: エキスパート レベルの評価モードが導入され、評価方法とランキング アルゴリズムが体系的にアップグレードされ、ランキング リストはモデル間の小さな違いにさらに敏感になります。
- 2026.01 ブランド アップグレード + シリーズ A: LMArena は Arena に名前変更され、「チャットボット アリーナ」からより広範な AI 評価プラットフォームに再位置付けされます。同期間中にシリーズ A で 1 億 5,000 万ドルの資金調達を完了。
- 2026.02 Max Model Router: 500 万を超えるコミュニティ投票に基づいてトレーニングされたインテリジェント ルーティング エンジンのリリース。これにより、アリーナの機能が「パッシブ評価」から「アクティブ スケジューリング」に移行します。
- 2026.05 マルチモーダル拡張機能: Fullstack Code Arena サブディビジョン ランキング (WebDev、Image-to-WebDev など) を追加し、マルチモーダル モデル ルーティングをサポートするために Multimodal Max をリリースしました。
- 2026.06 エージェント モード: オンライン エージェント評価機能。オープンな複数ステップのタスク評価をサポートし、エージェントの信頼性評価に対する業界の緊急のニーズに直接対応します。
- 2026.07 事実の正確さランキング: AI モデルにおける「幻覚評価の難しさ」という長年の問題点に対応して、人間の好みに加えて客観的な事実の正確さの側面を導入する事実リーダーボードを追加しました。
進化のメインライン: 「テキスト対話評価」から始まり、コード、画像、ビデオエージェント、実用性などの次元を順次カバーし、「純粋な評価」から「評価 + ルーティング + エンタープライズ サービス」のビジネス関係まで拡張します。それぞれのバージョンアップは、AI評価に関する業界の不安点に対応している。
アリーナの技術的利点
Arena の技術的価値は、単一モデルのパフォーマンスにあるのではなく、評価エンジニアリング システムの設計の深さとデータ フライホイールのスケール効果にあります。
ELO ランキング システムの統計の厳密さ: Arena は改良された ELO スコアリング システムを使用し、匿名のペアリング、ランダムな順序、および十分なサンプリングを通じてランキングの偏りを軽減します。そのランキング手法に関する論文は ICML による査読を受けており、単純な勝率や平均評価よりも統計的に信頼性が高くなります。 因果関係: 厳格なランキング手法 → より信頼できるランキング → コミュニティがより積極的に投票に参加する → より多くのデータ → より正確なランキング。
大規模な人間の嗜好データの不足: 7 億件以上の会話と 8,200 万以上の投票が、世界最大のオープンな人間の嗜好データセットの 1 つを構成しています。これらのデータの価値は「オープンなタスク + 実際のユーザー + 多次元の設定」にあり、静的ベンチマーク (MMLU、GSM8K など) のオーバーフィッティング リスクとは異なります。 HuggingFace のオープンソース データセットは、いくつかのモデル研究室の評価支援リソースとなっています。
Max ルーティング エンジンのエンジニアリング再利用: Max の推奨モデルは本質的にコミュニティ投票データの副産物であり、同じデータ ストリームがランキングの更新とルーティング モデルのトレーニングの両方に役立ちます。これにより、「より多くの投票 → より正確なルーティング → より良いユーザー エクスペリエンス → より多くのユーザーの投票」という正のフィードバック ループが形成されます。コストの観点から見ると、トレーニング データは無料ユーザーによって随時生成されるため、ルーティング機能の限界トレーニング コストは非常に低くなります。
マルチモーダル評価のための統合アーキテクチャ: テキスト、コード、画像、ビデオ エージェントなどのさまざまなモダリティは、「匿名比較 + 人間による投票 + ELO ランキング」という同じ基本フレームワークを共有するため、新しい評価要素を追加するエンジニアリング コストが削減されます。エージェント モードの特別な機能は、主観的な好みに加えて定量化可能なタスクの成功率を追加する、客観的な完了率測定の導入です。この設計アイデアは、その後の評価の標準化の参考になります。
技術的制約: 評価システムの中心となるボトルネックは技術的な実装ではなく、敵対的操作のガバナンスです。具体的なプロンプト単語の的を絞った最適化を通じてモデル研究室によるランキング操作を防ぐ方法、投票のブラッシングを検出する方法、プロンプト語彙の中立性と新鮮さを維持する方法です。コミュニティの規模が拡大し続けるにつれて、これらの問題はさらに顕著になるでしょう。
アリーナの使い方
Arena には主に Web 経由でアクセスし、さまざまな役割のニーズに合わせて複数の入り口を提供します。
| 使い方 | 群衆に適しています | 操作パス | 一般的な手順 |
|---|---|---|---|
| バトルモード | すべてのユーザー | arena.ai ホームページ → タスク タイプを選択 → プロンプト単語を入力 → 匿名出力を比較 → 投票 | 1 分以内にモデルの比較を完了します |
| 直接会話 | 特定のモデルが必要なユーザー | arena.ai → ダイレクトモード → モデルを選択 → 会話に入る | 多機種チャットクライアント相当 |
| ランキングを見る | 技術的な意思決定者 | arena.ai/leaderboard → ディメンションを選択 (全体/エージェント/コードなど) | 登録なしで見る |
| 最大ルーティング | 最適な回答を自動的に取得したいユーザー | arena.ai → Max Mode → プロンプトの単語を入力 | システムは自動的に最適なモデルを選択します。 |
| エージェントモード | 複数ステップのタスクを評価する | arena.ai/agent → タスクの目標を定義 → モデルの実行プロセスを観察 | オープンな長いタスクの評価をサポート |
幹部向けのクイック スタート: 技術的な意思決定者が Arena を評価ツールとして使用できるかどうかを評価する場合、必要な手順は 3 つだけです。① arena.ai/leaderboard にアクセスして、セグメント化されたランキングの構造が関心のある機能の側面をカバーしているかどうかを確認します。 ② (一般的なプロンプト ワードではなく) 独自のビジネス プロンプト ワードを使用して、バトル モードで 10 ~ 20 回比較し、結果の違いが実際の経験と一致するかどうかを感じます。 ③ 企業評価のカスタマイズ範囲とデータ分離スキームについては、[email protected] までお問い合わせください。
データ消費パス: 研究者と競合製品分析チームは、HuggingFace 上のオープンソース データセット (lmarena-ai) を直接ダウンロードできます。これには、完全な匿名の投票記録と、二次分析およびカスタム ランキング計算用のモデル出力が含まれています。
アリーナ製品の価格
価格モデルは公式リアルタイム ページに準拠します。通常はフリーミアムまたはサブスクリプションシステムが採用されます。基本機能は無料でご利用いただけますが、高度な機能や使用頻度が高い場合は有料のサブスクリプションが必要です。実際の使用状況に基づいて最適なソリューションを評価することをお勧めします。
アリーナ アプリケーション シナリオ
Arena の評価インフラストラクチャ機能は、さまざまな意思決定リンクに組み込むことができます。
-
モデルの選択と調達の決定: AI モデルを購入またはアクセスする前に、企業は Arena ランキングとカスタム比較を通じて候補を迅速に絞り込むことができます。 実装のヒント: セグメント化されたランキングの値は全体的なランキングよりも大きくなります。たとえば、メイン シナリオがフロントエンド コード生成である場合は、全体的なランキングではなく、WebDev および Image-to-WebDev のランキングに焦点を当てる必要があります。最初に Arena を使用して事前スクリーニングを行い、次に候補モデルを使用して自社のビジネス データに対して小規模な A/B テストを実施して最終的な決定を下すことをお勧めします。
-
モデル ラボでの反復検証: モデル開発チームは、リリース前に Arena のエンタープライズ評価サービスを通じて独立したサードパーティの人間の好みの評価を取得し、バージョン改善の効果を検証します。 コスト削減と効率の向上: 従来のモデルは、リリースする前に独自の評価チームとアノテーション プラットフォームを構築する必要があり、確立から出力まで通常 3 ~ 6 か月かかります。 Arena エンタープライズ レビューを使用すると、このサイクルを 2 ~ 4 週間に短縮でき、レビューのコストが数十万ドルから契約で合意された年間料金レベルまで削減されます。
-
エージェントおよび複数ステップのタスクの信頼性評価: エージェント製品の爆発的な増加により、従来の単一ラウンド評価では、複数ステップの推論やツール呼び出しのシナリオをカバーできなくなりました。 Arena のエージェント モードはオープン タスク コンテキストを提供し、カスタマー サービス エージェントの注文完了率やコード エージェントの構築成功率などの客観的な指標を評価するために使用できます。 シナリオの問題点: エージェントの評価における最大の困難は、「ゴールド スタンダード」を定義するのが難しいことです。同じタスクに対して、異なる実行パスが正しい可能性があります。 Arena Agent Mode では、人間の判断 + 客観的な完了率のハイブリッド評価を導入することで、この問題を軽減します。
-
教育とテクノロジーの普及: 教育シナリオでは、Arena のバトル モードで、異なるモデルが同じプロンプト ワードを処理する方法の違いを視覚的に表示できるため、学生がモデルの能力の限界を理解するのに役立ちます。月間アクティブ訪問者が 1,010 万人を超えるコミュニティの規模自体も、教育現場への浸透を反映しています。
アリーナ対象者
Arena の多層機能設計は 4 つの異なるタイプの役割を果たし、各層には異なる使用の深さと利点があります。
-
AI プロダクト マネージャーおよび技術的意思決定者: モデルの選択を行う必要がある人々。 Arena の核となる価値は、モデル メーカーから独立したサードパーティの評価データを提供することです。 推奨パス: まずランキング リストを使用して候補範囲を絞り込み (1 日)、次にバトル モードを使用して独自のシーン データで小規模な検証を実行し (3 ~ 5 日)、最後に企業評価に連絡して詳細な評価を行います (1 ~ 2 週間)。 不適当な境界: シーンが垂直性の高い場合 (医療画像診断、法的文書レビューなど)、Arena の一般的な評価データは十分に細分化されていない可能性があるため、独自のデータ セットに対してカスタマイズされた評価を行う必要があります。
-
モデル開発者および AI 研究者: モデル バージョンの反復効果を検証する必要がある人々。 Arena のエンタープライズ レビューは、社内のレビュー チームではカバーするのが難しい現実の人間の好みの側面を補完します。オープンソース データセットは、ランキング手法、好みの調整、モデル評価手法に関する研究にとって貴重なリソースでもあります。
-
エンタープライズ調達およびコンプライアンス チーム: 組織の AI ベンダーを選択する必要がある人々のグループ。 Arena の細分化されたランキングと公開方法論は、再利用可能な選択のデモンストレーション資料を提供します。 境界には適していません: 評価プラットフォームからのデータは、モデルのセキュリティの完全な評価を構成しません。シナリオに機密データや厳格なコンプライアンス要件 (HIPAA、GDPR など) が含まれる場合、独立したセキュリティ監査とコンプライアンス レビューが依然として必要です。
-
AI 愛好家および早期導入者: 複数のモデルに無料でアクセスできるバトル モードを通じて、最先端のモデルの機能の違いについて学びます。このようなユーザーは、プラットフォームの投票データへの主要な貢献者でもあります。
アリーナの概要と展望
Arena の核となる競争力は、「コミュニティ主導のデータ フライホイール + 商用評価サービス」の両輪モデルにあります。8,200 万を超える実際の人間の投票が非常に高いデータ障壁を構成し、企業評価サービスの急速な成長 (8 か月で 1 億ドルの ARR) は、この資産の商用面での収益化能力を証明しています。テキストからエージェント、ファクトへの能力拡張パスは、アリーナが「モデル チャット アリーナ」から「AI 機能の包括的な評価インフラストラクチャ」に進化していることを示しています。
現在の制限と不確実性: ① ランキングのサンプルの偏り - アクティブ ユーザーは主に技術者および早期採用者であり、普遍的なユーザーの好みを代表していない可能性があります。 ② 敵対的な操作のリスク - ランキングの商業的影響力が増大するにつれて、モデル研究室にはランキングのプロンプトワードを最適化するインセンティブがあり、ランキング方法はこのグッドハート効果と闘い続ける必要がある。 ③ 民営化された展開機能は公開されていません - データ主権に対する高い要件を持つ企業は、Arena が完全に分離された評価コンテキストをサポートしているかどうかを確認する必要があります。 ④ 多言語対応 - 現在の評価データは主に英語であり、中国語など英語以外のシナリオでのランキングの信頼性を検証する必要がある。
調達/採用リスク評価: モデル比較の参照ツールとして、Arena は非常にコスト効率が高く、無料利用枠ですでにコアの比較機能をカバーしています。ただし、エンタープライズレベルの調達の場合は、次の 3 段階で進めることをお勧めします。 ① 最初に無料枠を使用して、2 ~ 3 つのコア シナリオ (1 か月) でランキング データと実際のエクスペリエンスの一貫性を検証します。 ② より詳細な評価機能が必要な場合は、企業評価チームに連絡して、カスタマイズされたソリューションをリクエストし、顧客事例を参照してください。 ③ 契約に署名する前に、データの分離、結果の帰属、独占条件の確認に重点を置き、評価応答時間とデータ可用性の保証をカバーする SLA を要求します。最終的な選択の決定は、Arena の評価データに依存するだけでなく、独自のビジネス シナリオや独立したセキュリティ評価の実測結果と組み合わせる必要があります。
関連ツール: deepseek、chatgpt
アリーナの使い方
- Webクライアント:公式Webサイトにアクセスし、アカウントを登録することで利用できます。ほとんどの機能はインストールする必要がありません。
- API アクセス: RESTful API を提供し、開発者は API キーを取得して独自のアプリケーションに統合できます。
バージョン情報
- アリーナ プラットフォーム (エージェント モード + 事実リーダーボード) :新しい事実リーダーボードを追加し、エージェント モードの評価機能を月間 500 万回以上のインタラクション ラウンドに拡張し、マルチモーダル評価の範囲を継続的に改善しました。
- エージェント モード + フルスタック コード アリーナ :複数ステップの複雑なタスクの客観的な完了率と幻覚率の評価をサポートするエージェント モードをリリースしました。 Fullstack Code Arena ランキングを開始しました。
- 新しいカテゴリ + マルチモーダルマックス :Code Arena サブディビジョン ランキング (WebDev / Image-to-WebDev など) を追加しました。 Multimodal Max マルチモーダル モデル ルーティング機能をリリースしました。
- マックスモデルルーター :500 万を超えるコミュニティ投票に基づいて、ユーザー プロンプトを最も適切なモデルに自動的にルーティングする Max モデル ルーティング エンジンをリリースしました。
- LMArena リブランド → アリーナ :LMArena は正式に Arena に名前を変更し、ブランドのアップグレードと製品の拡張が完了しました。同期間中に、1億5000万米ドルのシリーズA資金調達を完了した。
- アリーナエキスパート :Arena Expert エキスパート レベルの評価モードを開始し、より洗練されたドメイン能力の評価次元とランキング手法の更新を導入しました。
- エンタープライズ評価の開始 :企業やモデル研究所向けにカスタマイズされたモデル評価を提供する商用評価サービス (AI 評価) を正式に開始しました。
ユーザーレビュー