C-評価
無料
C-Eval は、大規模な言語モデル用の中国語の包括的な評価スイートです。 52 科目と 4 つの難易度をカバーする 13,948 の多肢選択問題が含まれています。また、公開ランキングも提供されており、基本的な中国語モデルの能力を測定するために一般的に使用される学術ベンチマークの 1 つです。
C-評価
C-Eval のコアパラメータと統計
C-Eval はエンド ユーザー向けのアプリケーションではなく、研究者やモデル チーム向けの中国の大規模モデル評価ベンチマークのセットです。その中心的な価値は、「統一された比較可能な質問バンクを使用して、モデルの中国語の知識と推論能力を測定すること」です。これによって解決される問題点は、中国のシナリオには標準化された学際的な水平的な評価尺度が欠如していることだ。
| プロジェクト | 広報 |
|---|---|
| ベンチマークの種類 | 中国の大型モデルの多分野評価キット |
| 質問のサイズ | 13948 個の多肢選択問題 |
| 対象範囲 | 52 科目 |
| 難易度 | 4 つの難易度レベル (ベーシック、プロフェッショナル、大学院、総合) |
| 質問元 | 中国大学試験、大学院入学試験、職業資格試験、一般競争 |
| フォーマット | 公開質問銀行 + オンライン ランキング |
| オープンさ | データセットとコード GitHub オープン ソース (MIT ライセンス) |
| 請求モデル | 無料 (アカデミック ベンチマーク) |
| 評価プロトコル | 5ショットと0ショットの設定 |
| ランキングスケール | 数十の主流モデルの結果が継続的に含まれています。 |
パラメータの意味: 基本科目 (数学、物理学、化学) から専門分野 (医学、法律、コンピュータ)、高度な推論 (論理、倫理) までの全範囲をカバーする 13948 問。 52 科目の段階的設計により、モデルは全体的なスコアを生成するだけでなく、科目ごとにコンピテンシー プロファイルを分類することもできます。 4 つの難易度レベル (基礎、専門、大学院、総合) によって、単純な常識と高次の推論におけるモデル間のギャップがさらに区別されます。同じモデルでも基礎レベルでは満点に近いかもしれませんが、大学院レベルでは大幅に低下します。このギャップは、合計スコアよりもモデルの機能の真の深さをよりよく反映している可能性があります。
評価プロトコル: C-Eval は、デフォルトで 5 ショット (5 つの例) と 0 ショット (例なし) の 2 つの評価設定を提供します。 5 ショットの結果は通常、少量のコンテキスト学習 (コンテキスト内学習) の下でのモデルのパフォーマンスを反映しますが、0 ショットの結果はモデルの「裸の知識」の習熟度に近くなります。 2 つの違いは、モデルがサンプル形式にどの程度依存しているかを判断するのに役立ちます。
ベンチマークの比較: 同様の中国の評価ベンチマークと比較すると、C-Eval には主題の幅広さと難易度の階層化において明らかな違いがあります。
| ベンチマーク | 質問数 | 主題/分野 | 難易度 | 組織形態 | 言語 |
|---|---|---|---|---|---|
| C-評価 | 13948 | 52 科目 | 4つのレベル(基礎/専門/大学院/総合) | 多肢選択 | 中国語 |
| MMLU | ~15900 | 57 科目 | 明確な層別なし | 多肢選択 | 英語 |
| CMMLU | ~10000 | 67 科目 | 明確な層別なし | 多肢選択 | 中国語 |
| AGIEval | ~6800 | 20 種類以上の試験 | 試験ソース別のスコア | 多肢選択 + 空白を埋める | 中国語-英語 |
| ガオカオ | ~4500 | 9科目の大学入試問題 | グレードごとに分ける | 多肢選択 + 空白を埋める | 中国語 |
宣伝の検証: 公式ウェブサイトでは、これを「大規模な言語モデル (2023 年) に適したマルチレベルかつ複数の専門分野の中国語評価スイート」と明確に位置づけています。 13948 問と 52 分野、4 段階の難易度、オープンソース プロトコルなどの主要なパラメーターは、公式 Web サイトと GitHub リポジトリで直接確認できます。
C-Eval のユーザーおよび市場の認知度
- 研究と業界での採用: C-Eval は、中国の大型モデルの事実上の「導入テスト」となっています。 Almost all large domestic models (including DeepSeek, Tongyi Qianwen, Wenxinyiyan ChatGLM, Baichuan, Yi series, etc.) will list C-Eval scores when releasing technical reports or publicity as a key reference indicator of Chinese ability. According to public technical report statistics, there are more than 15 models with a total score of more than 90% in C-Eval's five classification accuracy rates (as of mid-2026), reflecting the continued attention of this benchmark in model iterations.
- 検証可能なデータ: 13,948 問、52 科目、4 つの難易度がすべて公式 Web サイトで公開されています。 The rankings are continuously updated on the official website, and the score entries submitted by each model are accompanied by submission time and setting instructions (such as 5-shot / 0-shot).
- Academic citations: C-Eval’s original paper has been cited more than 2,000 times on Google Scholar (as of mid-2026), becoming one of the most highly cited benchmark papers in the field of Chinese NLP evaluation.
- Community Ecology: The GitHub repository (hkust-nlp/ceval) publicly displays 400+ stars, 100+ forks, and active Issue and PR discussions, reflecting the academic community's concern for this standard and its willingness to continuously improve.
- 境界の説明: ランキング スコアは、各モデル チームによって提出されるか、第三者の評価によって取得されます。評価設定には違いがあります (プロンプトの文言、バッチ サイズ、出力デコード戦略などの変更)。 As a single-choice question benchmark, C-Eval does not cover dimensions such as generation quality, instruction following, and multiple rounds of dialogue, and cannot fully represent the model's comprehensive performance in real tasks. In addition, since the question bank is a static public question bank, there is a risk of being "memorized" by pre-training data (data pollution), that is, the model may have seen some questions during the training phase, thereby obtaining falsely high scores.
C-Eval のコスト上の利点
C-Eval自体には利用料はかかりませんが、評価にかかる費用全体を「個人研究者」「学術・モデルチーム」「企業の産業化評価」の3つのレベルに分ける必要があります。
Cサイド/個人研究員
- ツールコスト: コストはゼロです。データセットと評価コードは完全にオープンソースであり、GitHub から直接ダウンロードして使用できます。
- コンピューティング電力コスト: 独自の GPU をご用意ください。 1 枚のカード A100-80G で 13948 の質問を完全に評価するには、約 1 ~ 4 時間かかります (モデルのサイズとデコード効率によって異なります)。パラメーターが 7B 未満の小規模モデルの場合、単一のコンシューマー グレードの GPU (RTX 4090 など) で評価を完了できます。
- 隠れたコスト: 評価コンテキスト (Python、PyTorch、トランスフォーマーの依存関係) を正しく構成し、評価プロトコル (5 ショット テンプレート形式、回答抽出ルール) を理解する必要があります。初心者はこのセクションに 1 ~ 3 日かかるかもしれません。
API 開発者とモデル チーム
- ツールコスト: コストはゼロです。
- 統合コスト: C-Eval 評価スクリプトをモデル トレーニング パイプラインに統合するには (各チェックポイントが保存された後に自動的に実行されるなど)、エンジニアリングへの投資が必要です。公式の Python 評価スクリプトが提供されていますが、バッチ モデルのバージョン比較、結果の可視化、異常検出などの高度な要件は自分で開発する必要があります。
- 比較コスト: 同じ設定の下で競合モデルと公平に比較する必要がある場合は、競合モデル用に独自の推論コンテキストまたは API アクセスを準備する必要があります。コストのこの部分は、C-Eval 自体ではなく、モデルの呼び出し側に発生します。
エンタープライズおよび大規模な評価ニーズ
- ツールコスト: コストはゼロです。商用ライセンス料は不要で、MIT オープンソース ライセンスにより商用利用と再配布が許可されています。
- スケール評価コスト: 企業が数十のモデル バリアントに対して複数の評価 (さまざまな微調整戦略を使用した管理された実験など) を実行する必要がある場合、マシンのコストは直線的に増加します。公式スクリプトは並列評価をサポートしていますが、大規模なソリューションでは、チームが独自に分散評価フレームワークを構築する必要があります。
- コンプライアンス費用: なし。 C-Eval 問題バンクは、公開された学術資料と試験問題に基づいており、データセットのライセンスは MIT であるため、追加のコンプライアンス リスクはありません。ただし、企業が独自の評価セットや拡張質問を使用する場合は、企業自身で権利を確認する必要があります。
比較の次元: 自作の評価セットと比較して、C-Eval は既製の標準化された質問バンクと統一リストを提供し、構築 (通常 2 ~ 5 人月必要) と調整コストを節約します。評価に英語の MMLU を使用する場合と比較して、C-Eval は中国語のシナリオを指向しており、中国語の主題システムをカバーしており、中国語の知識と推論におけるモデルの真のレベルをより正確に反映できます。
C-Evalの主な機能
- 標準化された質問バンク: 52 科目をカバーする 13948 の多肢選択問題、各質問には 4 つの選択肢があり、統一された形式で、自動採点をサポートしています。科目は人文・社会科学(歴史、哲学、経済学など)、STEM(数学、物理学、コンピュータサイエンスなど)、医学(臨床医学、薬学、基礎医学など)、その他(論理学、倫理、法律など)の4つのカテゴリーに分かれており、中国の高等教育や職業資格試験の中核となる知識体系をカバーしている。
- 複数の難易度階層: 4 つの難易度 - Basic (学部の基本的な知識に対応)、Professional (専門分野の深い知識に対応)、Postgraduate (大学院レベルの高度な概念に対応)、Comprehensive (学際的な包括的な応用)。この階層化は、モデルの「広さ」を測定するだけでなく、「深さ」も区別できます。基礎レベルで 90% のスコアを獲得し、大学院レベルでは 50% しかスコアを獲得しないモデルと、両方のレベルで 80% のスコアを獲得するモデルは、まったく異なる研究開発パスに対応する可能性があります (前者は高次の推論を強化する必要があり、後者は知識の盲点を修復する必要があります)。
- 公開ランキング: 公式ウェブサイトでは、各モデルの 5 ショットおよび 0 ショットのスコアを継続的に収集し、全体の平均スコアによって並べ替えられます。ランキング一覧には科目内訳、提出日、スコアごとの評価設定が付いており、横からの参照も容易です。ランキングの提出プロセスに制限はありませんが、提出者は基本的な比較可能性を維持するために評価構成を指定する必要があります。
- オープンソース コードとデータ: GitHub リポジトリは、完全なデータ セット (JSON 形式)、評価スクリプト (Python、lm_eval フレームワークに基づく)、プロンプト テンプレート、および回答抽出ロジックを提供します。カスタム モデル アクセスをサポートし、標準のテキスト生成インターフェイス (入力→出力→スコアリング) を実装するだけです。コミュニティにはすでに多くの解釈記事やサードパーティによる改良版(多言語拡張、適応型評価難易度調整など)が存在します。
- 被験者レベルの診断レポート: C-Eval の被験者分類の粒度は、モデルを生成する機能をサポートします。
「レーダーチャート」。たとえば、モデルはコンピューター サイエンスと数学では高いスコアを獲得しても、法医学科学や倫理では大幅にスコアが低い場合があります。この詳細な診断により、単一の合計スコアよりも適切にターゲットを絞ったトレーニング データの補充をガイドできます。
C-Eval のモデルとバージョンの進化
学術的なベンチマークとして、C-Eval の「バージョン反復」は、従来の意味でのソフトウェア バージョン番号の増加ではなく、主にデータ セットのメンテナンス、ランキング リストの更新、評価プロトコルの最適化の 3 つのレベルに反映されます。
1. 初回リリース (2023-05)
- 最初に論文「C-Eval: A Multi-Level Multi-Discipline Chinese Evaluation Suite for Large Language Models」とともに出版されました。
- 52 科目と 4 つの難易度で 13948 問のコア構造を確立します。
- GPT-4、ChatGPT、Claudeなどのモデルの最初のバッチの結果を含む初期ランキングリストが公開されます。
- 論文が発表された時点では、5 ショット設定での GPT-4 の合計スコアは約 68% でしたが、当時の中国のオープンソース モデルの最高スコアは約 45% ~ 50% でした。これは、中国モデルと外国モデルの間の中国語知識の大きなギャップを反映しています。
2. データセットの改善とプロトコルの微調整 (2023-06 から 2024-06)
- コミュニティからのフィードバックに基づいて、一部の質問に対する誤った回答や主題分類の逸脱を徐々に修正していきます (GitHub の問題は追跡できます)。
- デフォルトの評価プロトコルとして 5 ショットが明確に推奨されており、結果の比較可能性を向上させるためにプロンプト テンプレートが標準化されています。
- さまざまなモデル シリーズ (MoE アーキテクチャ、強化学習微調整モデルなど) の互換性テストを追加しました。
- ランキングに含まれるモデルの数は当初の数十から数十に拡大され、主流のオープンソース モデルとクローズド ソース モデルがカバーされています。
3. 継続的な影響力の拡大 (2024-06 年から現在まで)
- C-Eval スコアは、中国の大型モデルの技術レポートの「標準」指標になりました。
- その後の派生作品 (C-Eval Hard、C-Eval Zero など) は、C-Eval に基づいた敵対的サンプルまたはゼロ サンプルの評価の難易度を高めることを試みます。
- オリジナルの論文は、中国の NLP 評価の分野で非常に引用されるベンチマーク論文となっています。
- データ汚染の課題に直面する: 元のデータセットが広く公開されるため、後続のトレーニング モデルがトレーニング データの漏洩を通じて受動的に質問にさらされ、誤って高いスコアが得られる可能性があります。コミュニティではすでに、代替手段として目に見えない質問を備えた動的な質問バンクの構築について議論しています。
C-Eval の技術的利点
- 主題と難易度の 2 次元の設計: C-Eval の核となるイノベーションは、「主題分野」と「難易度」という 2 つの直交する次元から同時に質問を整理することです。これにより、評価出力は単なる合計スコアではなく、52×4 の能力マトリックスになり、各グリッドは特定の科目の特定の難易度でのモデルのパフォーマンスを表します。中国の高等教育における「幅広い口径と厚い基盤」という文脈では、この粒度は、MMLU の単一科目分類よりもモデルの知識構造の欠点をうまく捉えることができます。
- 中国の再現可能な評価プロトコル: C-Eval は、プロンプト形式、回答抽出ルール、および 5 ショットと 0 ショットの採点基準を明確に規定しています。データセットのみを提供し、評価プロトコルについては厳密に一致していないいくつかのベンチマークと比較して、C-Eval の高度な正規化により、異なるチームおよび異なる時点の結果が基本的に水平的に比較できることが保証されます。これが、広く採用されている主なエンジニアリングの理由です。
- 試験主導の問題設計: 問題は、研究者が独自に編集したものではなく、実際の中国語の試験 (大学の卒業試験、大学院入学試験、専門資格試験) から出典されています。これは、質問が自然に次のような性質を持つことを意味します。 (1) 言語は現実的で自然であり、「データセット言語」の人工的な印象はありません。 (2) 回答には明確な権威のある基準があり、主観的な曖昧さはありません。 (3) これらは中国の教育知識システムと整合しており、中国の文脈におけるモデルの知識レベルを直接反映できます。これには制限も伴います。出題の適時性は試験時間によって制限され、新興分野 (AI 倫理、量子コンピューティング、まだ標準化試験に入っていないその他の科目など) のカバー率は低いです。
- 評価 - 診断 - 終了: C-Eval の技術的価値は単に「スコアから」ではなく、対象の粒度での診断機能にあります。 C-Eval の結果を受け取った後、モデル チームはすぐに弱い被験者を特定し、対象を絞った方法でその被験者の事前トレーニング データまたは微調整データを補うことができます。この評価から改善、そして次の評価までのプロセスは、
C-Eval を、ゴールラインではなく、モデル機能の反復のためのダッシュボードにします。
C-Eval の使用方法
入口の比較
| 目的 | エントリー | 説明 |
|---|---|---|
| 説明とランキングを表示 | https://cevalbenchmark.com/ | 公式サイト、閲覧位置、ランキング、主題分類 |
| データセットとコードをダウンロード | https://github.com/hkust-nlp/ceval | GitHub リポジトリ、完全なデータ セット、評価スクリプト |
| 論文を読む | https://arxiv.org/abs/2305.10957 | arXiv、設計原則とベースライン結果を理解してください |
| コミュニティディスカッション | GitHub の問題、Zhihu | フィードバックの問題、ディスカッションおよび評価の設定 |
標準的な評価手順
- 境界の準備: リポジトリのクローンを作成し、Python の依存関係 (PyTorch、トランスフォーマー、データセットなど) をインストールします。
- データの読み込み: ウェアハウスが提供する
ceval/データ ディレクトリを使用するか、Hugging Face データセットを通じてceval/cevalを読み込みます。 - 評価の設定: 評価パラメータを設定します - モデル名またはパス、評価設定 (5 ショットまたは 0 ショット)、最大生成長など。
- 評価の実行: 評価スクリプトを実行すると、スクリプトが自動的にモデルをロードし、推論と回答を実行し、回答を抽出し、標準回答と比較し、各被験者の精度と全体の精度を計算します。
- 結果分析: 出力された結果 (各被験者の正答率と全体の平均) を確認し、ランキングと比較してギャップを見つけます。
重要な注意事項
- プロンプトの一貫性: プロンプト テンプレートの小さな変更 (「回答は」と「回答:」など) により、スコアが 1 ~ 3 パーセント変動する可能性があります。使用するプロンプトが公式のデフォルト テンプレートと一致していることを確認してください。そうでない場合、結果は比較できなくなります。
- デコード戦略: 貪欲なデコード (「温度=0」) または一貫した設定を使用することをお勧めします。ビームサーチやサンプリングなどの戦略は出力を不安定にし、再現性に影響を与えます。
- 被験者の重み付け: ランキングの全体の平均スコアには、(単純な算術平均ではなく) 被験者の加重平均が採用されています。比重は主題の質問数によって異なります。ランキングを比較するときは、重み付け方法が一貫していることを確認する必要があります。
C-Eval の製品価格
| ユーザーレベル | 費用項目 | 説明 |
|---|---|---|
| Cサイド/個人研究者 | 無料 | データセットとコードは完全にオープンソース、MIT ライセンス、ライセンス料は無料です。 |
| アカデミック/モデルチーム | 無料 | 購読料やペイパービューは不要で、無制限のレビュー |
| エンタープライズ | 無料(ツールレイヤー) | ツール層のコストはゼロ。大規模な評価には自己準備のコンピューティング クラスターが必要です。 |
| 商用利用 | 無料 | MIT ライセンスでは、追加の許可なしで商用利用と再配布が許可されています。 |
含まれるコスト: 評価の主なコストはツール自体ではなく、モデル推論のコンピューティング能力とエンジニアリングの統合です。完全な C-Eval 評価 (13948 問、5 ショット) のコンピューティング消費電力はモデルのサイズによって異なります。7B モデルでは約 0.5 ~ 1 GPU 時間 (A100)、70B モデルでは約 4 ~ 8 GPU 時間、700B+ モデルでは 24 時間以上かかる場合があります。頻繁な評価が必要な場合 (各トレーニング チェックポイント後など)、総コンピューティング電力コストは急速に蓄積されます。
C-Eval の適用シナリオ
- モデル開発セルフテスト: 大規模な中国語モデルをトレーニングまたは微調整する場合は、各主要チェックポイントの後に C-Eval 評価を実行して、知識と推論能力の反復方向が正しいかどうかを検証します。 合格点: 前後の 2 つの評価間の被験者レベルの変化を比較します。合計スコアは増加したが、特定の被験者が大幅に低下した場合、それは壊滅的な忘却を意味する可能性があり、トレーニング データの比率を確認する必要があります。
- 外部能力開示: モデルがリリースまたはアップグレードされると、C-Eval の結果が、中国語能力に関するサードパーティの参考資料として技術レポートまたは公開ページにリストされます。 合格の重要なポイント: ランキングとの整合性を確保するために、評価設定 (5 ショット/0 ショット、プロンプト バージョン、採点方法) を明確にマークします。非標準設定が使用されている場合は、水平比較のために標準設定でのスコアも提供する必要があります。
- 被験者の診断とトレーニングのガイダンス: C-Eval の被験者の粒度の結果を通じてモデルの機能の欠点を特定し、その後のデータ収集とトレーニング戦略を導きます。たとえば、「法」と「医学」の分野でモデルのパフォーマンスが引き続き低い場合は、事前トレーニング段階で対応する分野の中国語コーパスを追加するか、SFT 段階で分野の質問と回答のペアを補足することを検討できます。 承認キー: 診断の結論はトレーニング データの分布と相互検証する必要があります。特定の科目のスコアが低いのは、その科目の知識トレーニングが不十分であることが原因である可能性があります。または、C-Eval の質問表現方法とトレーニング データの分布の間の不一致によって引き起こされる一般化の問題である可能性があります。
- 学術研究とベンチマーク構築: 中国の NLP 評価の参照ベースラインとして、新しく提案された評価方法やデータセットを比較するために、またはモデル間の機能比較のための標準化されたプラットフォームとして使用されます。 受け入れポイント: 新しく提案された評価方法は、モデルの実際の機能との相関関係を C-Eval で検証する必要があります。
C-Eval の適用可能なグループ
- 大規模モデル研究者およびアルゴリズム エンジニア: モデルの反復効果を定量化し、主題の詳細な診断を通じてトレーニング戦略を導くには、標準化された中国語評価が必要です。 前提条件: 基本的なモデル推論と状況に応じた構築能力があり、Prompt プロジェクトと評価プロトコルを理解しています。
- モデル評価エンジニア: チーム用の自動評価パイプラインの構築、C-Eval の CI/CD プロセスへの統合、モデル バージョンの機能変更の継続的な追跡を担当します。 前提条件: Python および主流の大規模モデル推論フレームワーク (Hugging Face Transformers、vLLM など) に精通しており、分散評価シナリオを処理できる。
- 学術研究者: 新しい手法や新しいデータセットを比較するためのベースラインとして C-Eval を使用して、中国の NLP 評価、ベンチマーク調査、およびクロスモデル分析に従事しています。 前提条件: 評価方法を理解し、データ汚染の問題が実験結果に及ぼす影響に注意を払ってください。
- 技術選択評価者 (CTO/技術副社長): 基本モデルを購入または導入する前に、中国語能力の定量的側面として C-Eval スコアを評価マトリックスに組み込みます。 前提条件: 単一ベンチマークの限界を認識し、シナリオベースの評価 (製品の機能テスト、小規模なグレースケール検証など) に基づいて総合的な判断を下します。
- 不適合境界: (1) 「利用可能な製品機能」を直接取得する必要がある一般ユーザー - C-Eval は対話型アプリケーションではなく評価ベンチマークであり、直接使用することはできません。 (2) 対話の質、セキュリティ、アイデア生成などの未解決のタスクに関するモデルのパフォーマンスを評価する必要があるチーム - C-Eval 多肢選択式の質問形式では、生成能力の測定をカバーできません。 (3) データ汚染を心配するチーム - 静的質問バンクは事前トレーニング データでカバーされる可能性があるため、相互検証のために他の目に見えない質問バンク (内部で自己構築された評価セットなど) を組み合わせることが推奨されます。 (4) 中国語以外のシナリオでモデルを評価する必要があるチーム - C-Eval は完全に中国語と中国語の主題システムを指向しており、英語のモデル評価を最適化する必要があります。
まず、MMLU または同等の英語のベンチマークを使用します。
概要と展望
52 科目と 4 つの難易度レベルからなる 13,948 問の C-Eval は、最も体系的な中国の大規模モデル評価ベンチマークの 1 つを構成します。その核となる競争力は、主題と難易度の 2 つの側面の洗練された設計、再現可能な評価プロトコル、継続的に更新されるランキングにあります。これら 3 つが連携して、C-Eval をデータセットから標準化された評価エコシステムに引き上げます。中国の基礎モデルチームにとって、C-Eval は「入学テスト」であると同時に「診断ツール」でもあります。合計スコアは習熟度のレベルを測定し、科目レベルのスコアは欠点の方向性を明らかにします。
現在の制限: (1) 静的質問バンクはデータ汚染のリスクに直面しています。質問バンクは広く公開されているため、トレーニング後のモデルはトレーニング データの漏洩を通じて受動的に質問を取得し、その結果、誤って高いスコアが得られ、ベンチマークの信頼性が低下する可能性があります。 (2) 多肢選択式の質問形式では、生成タスク (翻訳品質、コード機能の正確さ、創造的な文章など) の評価ニーズをカバーできません。 (3) 主題の範囲は伝統的な知識システムに偏っており、AI には良くありません。倫理、量子コンピューティング、新興工学分野などの将来を見据えた主題は十分にカバーされていません。 (4) ランキングの提出とレビューは自律的なメカニズムに依存しており、さまざまなモデル間のスコアの比較可能性は評価設定の違いに影響されます。
今後の方向性: コミュニティは、データ汚染の問題を軽減するために、C-Eval の動的な質問バンク バージョン (非公開質問プール、適応型質問設定など) をすでに検討しています。同時に、マルチモーダルバージョンと中国語と英語のバイリンガル拡張も自然な拡張方向です。 C-Eval がベンチマーク ステータスを維持するには、コミュニティの継続的なメンテナンスとトピックの更新が鍵となります。
調達/採用リスク評価: 基本モデルまたは自社開発の大規模モデルを評価しているチームにとって、C-Eval は低コストで信号対雑音比が高いエントリーレベルの評価ツールです。ライセンス料はゼロで、オープンソースで再現可能で、対象者ごとに詳細な診断機能がトレーニングを直接ガイドできます。しかし、それを唯一の評価基準として使用すべきではありません。単一のベンチマークの逸脱によって引き起こされる選択のリスクを軽減するために、モデルの選択または研究開発の反復中に「C-Eval + いくつかのシナリオベースの内部評価 + 小規模な手動評価」の多次元評価の組み合わせを使用することをお勧めします。チームが水平比較に C-Eval スコアを使用する場合、設定の違いによる誤解を招く結論を避けるために、すべてのスコアが同じ評価設定 (5 ショット/0 ショット、同じプロンプト テンプレート) の下で取得されていることを確認する必要があります。
関連ツール: hugging-face、replicate
バージョン情報
- C-Eval 評価キット (2023) :公開された中国の大型モデルの多分野評価キットには、52 科目と 4 つの難易度の 13,948 個の多肢選択問題が含まれており、モデルの結果を継続的に記録するためのオンライン ランキングが提供されます。公式ページには 2023 年と記載されていますが、正確な日付は紙や倉庫によって異なります。
- C-Eval の論文とデータセットが初めてリリースされました :C-Eval は論文とデータセットとともに初めてリリースされ、質問バンク、主題分割、評価プロトコルが確立され、オンラインでランキングが開始されます。後続のマイナー バージョン番号の正式なリストはなく、反復は主にランキングの継続的な更新に反映されます。
ユーザーレビュー