CMMLU 無料

-

CMMLU は、総合的な中国語の大規模モデル評価ベンチマークであり、人文科学、社会科学、科学、工学、中国語特有の知識などの複数の分野の多肢選択問題をカバーしています。これは、中国語のコンテキストにおける大規模な言語モデルの知識の蓄積と推論能力を測定するために使用されます。データセットと評価コードは GitHub 上のオープンソースです。

CMMLU 製品インターフェース

CMMLU

CMMLU のコアパラメータと統計

CMMLU (中国語大規模マルチタスク言語理解) は、中国語の大規模言語モデルのマルチドメイン知識評価ベンチマークのセットで、2023 年に学術研究チームによって公開される予定です。エンドユーザー向けのチャット機能や生成機能は提供しませんが、研究者とモデル開発チームに、中国語のコンテキストにおける事実知識の埋蔵量とモデルの推論精度を測定するための 67 分野をカバーする標準化された中国語知識質問バンクを提供します。

パラメータ項目
ベンチマークの正式名 CMMLU (中国語大規模マルチタスク言語理解)
総質問数 約 11,500 の多肢選択問題
対象範囲 人文科学、社会科学、理工学、中国独自の知識の 4 つのカテゴリーに分類される 67 分野
オプション構成 4 つ (A/B/C/D) から 1 つを選択します。
質問の種類 知識ベースの多肢選択問題 (事実の記憶 + 推論と判断)
出力インジケータ 各被験者の精度 (Accuracy) と全体の平均精度
ライセンス契約 オープンソース (GitHub パブリック リポジトリ)
最初の論文 arXiv 2023
評価方法 ローカル推論 + スクリプト スコアリング、少数ショットおよびゼロショット設定をサポート
依存関係 PyTorch / トランスフォーマー + 評価スクリプト

パラメータの意味の解釈: 67 人の被験者の分割粒度は、MMLU (57 被験者) および C-Eval (52 被験者) よりもはるかに細かいため、CMMLU は被験者の次元でよりきめ細かい能力診断機能を提供します。合計約 11,500 問という質問数は数万問ほど多くありませんが、被験者あたりの平均密度が約 170 問であるため、統計的に有意な被験者レベルの精度比較をサポートするには十分です。 4 択形式では、ランダムな推測ベースライン (25%) が削減されるため、30% ~ 40% の精度区間でも識別値が得られ、難しい主題におけるモデルの欠点を特定するのに適しています。

同様のベンチマークとのスケール比較:

ベンチマーク 被験者数 質問数 言語 中国特有の知識
MMLU 57 ~14,000 英語 なし
C-評価 52 ~13,900 中国語 部分的
CMMLU 67 ~11,500 中国語 主要な範囲
AGIEval 20歳以上 ~8,000 中国語/英語 部分的

タイプの決定: CMMLU は、「基本的な大規模モデル/API インフラストラクチャ」のカテゴリに属する​​モデル評価インフラストラクチャに属します。中心的な成果物は、標準化されたデータセット + 評価プロトコル + ベースライン スコアのセットです。 API サービスを継続的に実行する必要はありませんが、モデル開発チェーンにおいて不可欠な品質ゲート制御です。

CMMLU のユーザーと市場の認知度

  • 学術的な引用と影響: CMMLU 論文が arXiv で公開された後、CMMLU スコアを報告した Qwen、Yi、Baichuan、InternLM およびその他の一連のモデルのリリースを含む、技術レポートや論文で複数の中国の大規模モデル チームによって機能の証拠として引用されました。 2026 年半ばの時点で、その GitHub リポジトリには何千ものスターが付けられており、コミュニティのフォークや問題に関するディスカッションが活発に行われています。

  • 産業採用モデル: 国内の大手模型メーカーは通常、中国語知識能力の標準評価の組み合わせとして CMMLU と C-Eval を使用しています。モデル機能の比較表では、CMMLU の全体的な精度と各主題の精度が、最も頻繁に引用される中国のベンチマーク指標の 1 つです。一部のチームは、トレーニング中に機能の低下を検出するために、CMMLU を毎日の回帰テスト パイプラインに組み込んでいます。

  • C-Evalとの位置付けの違い:C-Evalは一般科目における中国の大学入試・大学院入試の難問に重点を置いているのに対し、CMMLUは中国独自の知識(中国の歴史、地理、法律、文学など)の網羅に重点を置いています。全体的な主題分布では、両者の間に約 60% の重複がありますが、中国固有の知識カテゴリにおける CMMLU の深さは大幅に高くなります。多くのチームは、中国語の熟練度をより完全に把握するために、両方のベンチマークのスコアを同時に報告しています。

  • 境界注意: 多肢選択式質問のベンチマークにはデータ汚染のリスクが内在しています。モデルはトレーニング前の段階で質問の元のテキストを認識し、誤って高いスコアをもたらした可能性があります。現時点では、CMMLU チームは独立したホールドアウト プライバシー セットや動的な質問生成メカニズムを確立していないため、スコアを引用する場合は、同じモデルのバッチの MMLU/C-Eval トレンド相互検証と組み合わせる必要があります。さらに、高いスコアは事実の知識の量のみを反映しており、モデルの推論の深さ、会話の質、指示に従う能力を表すものではありません。

CMMLU のコスト上の利点

C 側/個人研究者:

  • 直接コストゼロ: データセットと評価スクリプトは完全にオープンソースであり、ライセンス料やサブスクリプション料を支払うことなく、GitHub リポジトリを直接複製して使用できます。
  • ランニングコスト: 評価には、モデルをロードし、独自のハードウェアまたはクラウド インスタンスで推論を実行する必要があります。 7B パラメータ スケール モデルを例にとると、1 台の A100 で 67 の被験者すべての推論を完了するには約 30 ~ 60 分かかり、対応するクラウド コンピューティングのコストは約 1 ~ 3 ドルです (オンデマンド価格に基づいて推定)。 700 億を超えるスケール モデルに必要な計算能力は直線的に増加し、1 回のフルスケール評価の推定コストは 10 ~ 30 ドルの範囲になります。

API 開発者/モデル サービス プロバイダー:

  • 自社構築の代替コスト比較: 67 科目と各科目約 170 問をカバーする中国語評価セットをゼロから構築する場合、質問の開発、レビュー、テスト、調整を行う科目の専門家を雇う必要があります。人件費は数十万元と見積もられる。 CMMLU は、検証済みの質問バンクとベースラインをライセンス料ゼロで直接提供することで、このコストをゼロに削減します。
  • 統合コスト: 評価スクリプトは、Hugging Face トランスフォーマーとデータセット ライブラリに基づいており、追加の適応を必要とせずに主流のモデル フレームワークと自然に互換性があります。 CMMLU 評価をモデル トレーニング パイプラインに統合するエンジニアリング コストは、通常 1 ~ 2 人日以内です。

企業/機関:

  • プライベート展開: データ セットは完全にオフラインで使用でき、データ セキュリティとコンプライアンスの要件を満たすために外部 API に依存しません。評価結果は地域を離れず、データのエクスポートに厳しい制限がある金融、医療、官公庁などの業界に適しています。
  • 隠れたコスト - 評価プロトコルの一貫性: プロンプト テンプレートの少数ショット サンプル選択と回答抽出ロジックにおける異なるチーム間の小さな違いにより、スコアの偏差が 3 ~ 5 パーセント ポイントになる可能性があります。水平的に比較可能な結果を​​得るには、公式に推奨されている評価パラメータ (ゼロ ショットまたは 5 ショット、統一されたプロンプト形式) を厳密に実装する必要があります。プロトコルが調和していない場合、報告されるスコアは比較できない可能性があります。

CMMLUの主な機能

  • 多分野の標準化された質問バンク: 67 科目をカバーし、人文科学 (中国文学、歴史、哲学など)、社会科学 (法律、経済学、教育など)、科学および工学 (数学、物理学、コンピューターなど)、および中国特有の知識 (中国政治、中国地理、中国民間伝承など) の 4 つのカテゴリに分類されています。各科目には約 170 の質問があり、4 択形式で、25% のランダムなベースラインがあります。 使用価値: 中国語の知識能力の標準化された測定尺度を提供し、異なるモデルを同じ尺度で比較できるようにします。

  • 柔軟な評価フレームワーク: ゼロショットと少数ショット (デフォルトは 5 ショット) の 2 つの評価設定をサポートします。プロンプト テンプレート、サンプルの数、順序は、さまざまなモデルの最適なパフォーマンス範囲に適応するように調整できます。 使用値: チームは、モデル タイプ (ベース微調整とコマンド微調整) に基づいて最適な評価設定を選択し、単一のスタイルによって引き起こされる逸脱を回避できます。

  • オープンソースのベースライン結果: ウェアハウスは、GPT-4、Claude、Qwen、Baichuan、InternLM、Yi およびその他のシリーズを含む、さまざまな分野の複数の主流モデルの精度ベースラインを公開しています。 使用価値: 新しいモデル チームは、リファレンス システムを最初から確立することなく、ベースラインに対して機能のレベルを直接判断できます。

  • 被験者レベルの能力診断: 評価スクリプトは各被験者の独立した正解率を出力し、水平比較のためのレーダー チャートまたはヒストグラムを自動的に生成できます。 価値を使用: モデルが得意な科目 (中国史、文学など) と苦手な科目 (高度な数学、物理学など) を正確に特定し、データ マッチングとトレーニング戦略の調整のための定量的根拠を提供します。

  • コミュニティのスケーラビリティ: データセットとコードは完全に公開されています。研究チームは、被験者の追加または削除、質問の変更、新しいモデル ベースラインの追加、または評価スクリプトからインターフェイスを抽出してカスタム テスト パイプラインに埋め込むことができます。 使用価値: 特定の業界 (法律、医療など) を対象とするチームは、CMMLU に基づいて垂直分野の評価セットを構築し、既製の評価ツール チェーンを再利用できます。

専門家の意見: CMMLU の「被験者レベルの診断」と「ベースラインの比較」には関連性があります。ベースラインは基準の枠組みを提供し、被験者のスコアは欠点を特定します。この 2 つを組み合わせることで、モデル チームはモデルの品質を測定するために全体のスコアだけに頼ることがなくなり、「どの主題が X パーセントポイント悪いか」を正確に把握できるようになります。このリンクは、トレーニング データ比率の最適化、コース学習戦略の設計、ドメインの強化と微調整のためのデータ選択を直接導く重要な意味を持ちます。

CMMLU のモデルとバージョンの進化

メインライン リリース

  • 論文の初版 (2023-06): arXiv 論文公開データセット v1.0 と評価契約に加えて、67 の主題区分と 5 ショットの評価仕様が確立されています。この論文では、GPT-4、ChatGPT、および複数の初期の中国モデルのベースライン結果も報告しています。これは CMMLU の最初のマイルストーンであり、その後のすべての更新はこのリリースに基づいています。

  • データセットの更新 (~2024): コミュニティからのフィードバックに基づいて、一部の主題における質問の誤りと回答のラベル付けの問題が修正され、少数の新しい主題の質問が追加されました。正式なバージョン番号は個別に記載されておらず、更新記録は GitHub コミット ログの対象となります。 変更点: 約数十のエラーが修正され、被験者の総数は 67 名のままです。

  • 継続的なメンテナンス期間 (2024 年から現在): ウェアハウスは、コミュニティからフィードバックされた問題レポートと提案を管理するために Issue を使用し、定期的に PR をマージして修正します。ベースライン スコア テーブルは、新しいモデルがリリースされると継続的に更新されますが、データ セット オントロジーへの構造的な変更は安定する傾向があります。 変更点: ベースライン モデルの数は増加し続けていますが、データ セットのコア構造は大幅に変更されていません。

バージョンコンテキストの重要なポイント

CMMLU のバージョン進化機能は、商用製品のセマンティックなバージョン管理とは異なり、「データセットの 1 回リリース + ベースラインの継続的な更新」というアカデミックなベンチマーク モデルです。データセット自体は、リリース以来正誤表レベルでのみ改訂されており、構造の拡張やバージョン番号のジャンプは発生していません。引用する場合は、論文の発行日と GitHub コミット ハッシュが優先されます。

バージョンマイルストーン 日付 主要な変更点
論文の初リリース ~2023-06 パブリック 67 被験者データ セット v1.0、評価スクリプト、ベースライン スコア
正誤表の更新 ~2024年 いくつかの質問の誤りを修正し、主題を補足し、バージョン番号のジャンプを修正しました。
継続的なメンテナンス 2024年から現在まで ベースライン モデルは拡張を続け、データ セット構造は安定したままです。

CMMLU の技術的利点

仕組み: CMMLU は、「静的データセット + ローカル評価スクリプト」のオフライン評価アーキテクチャを採用しています。データセットには、質問文、4 つの選択肢、各質問の正解インデックスが JSON 形式で保存されます。評価スクリプトは、質問を順番に読み取り、プロンプトを作成し、モデル推論を呼び出し、回答を比較し、主題ごとに精度をカウントします。

効果

  • オフラインで完全に再現可能: すべての評価ロジックはローカルで実行され、外部サービスに依存しません。同じバージョンのデータセットとスクリプトを使用するチームは、一貫した結果を得ることができます。これにより、API バージョンの違い、サービスの更新、オンライン レビューでのランダム サンプリングなどの制御不能な要因によって引き起こされるスコアへの干渉が排除されます。

  • きめ細かい被験者診断: 67 人の被験者の粒度は、中国の評価ベンチマークの最前線にあります。 MMLU の 57 科目と C-Eval の 52 科目を比較すると、CMMLU は、モデルの中国の地域知識の習熟度を個別に測定できるように、「中国固有の知識」カテゴリに多数の下位部門 (中国の政治制度、中国の民間伝承、古代中国の歴史など) を追加しました。

  • MMLU との補完設計: CMMLU および MMLU の主題設定は、単に中英翻訳に関連するものではありません。 MMLU がカバーする専門分野は西洋の知識システムに基づいていますが、CMMLU には中国独自の知識と評価の側面が多数追加されています。 MMLUとCMMLUを同一機種上で同時に動作させることで、「一般知識能力」と「中国語文脈知識能力」の二次元の差異を分離することができます。たとえば、MMLU で良好なパフォーマンスを発揮するモデルは、CMMLU の中国固有の知識カテゴリではスコアが低い可能性があり、このモデルが中国語の事前トレーニング データで中国文化を十分にカバーしていないことを示唆しています。

適用可能なシナリオ: CMMLU は、リリース前の最終的な宣伝指標としてではなく、モデル開発段階の機能診断ツールとして適しています。トレーニング プロセス中に CMMLU 評価を定期的に実行すると、特定の対象におけるモデルの能力の低下 (過剰な調整による事実知識の忘却など) を迅速に検出できます。レポートを公開する場合、単一ベンチマークのスコアの過剰解釈を避けるために、CMMLU を C-Eval、MMLU、AGIEval などと組み合わせて評価スイートを形成することをお勧めします。

CMMLUの使用方法

入場管理:

入口 目的 コスト
GitHub リポジトリ (haonan-li/CMMLU) データセットのダウンロード、評価スクリプト、ベースライン結果、ドキュメント 無料
arXiv 論文 メソッドの説明、主題の定義、初期のベースライン 無料
ハグ顔データセット データセット ライブラリを通じて CMMLU を直接ロードします。無料

一般的な手順:

  1. データセットを取得: git clone https://github.com/haonan-li/CMMLU.git または datasets.load_dataset("haonan-li/cmmlu") を通じて直接ロードします。
  2. モデルの準備: 評価対象のモデルが Hugging Face トランスフォーマーの AutoModelForCausalLM を通じてロードできることを確認するか、互換性のある推論インターフェイスを実装します。
  3. 評価の実行: 評価スクリプトを実行し、モデル パス、評価設定 (ゼロ ショットまたは 5 ショット)、出力ディレクトリ、およびその他のパラメーターを指定します。コマンドの例: python eval.py --model Qwen/Qwen2-7B --shot 5 --output ./results
  4. 結果の表示: スクリプトは、各被験者の正解率と全体の平均正解率を出力し、被験者間の視覚的な比較グラフも生成します。

適応に関するヒント:

  • プロンプト形式は統一する必要があります: プロンプト テンプレートが異なると (役割の説明を追加するかどうか、中国語のコマンド プレフィックスを使用するかどうかなど)、スコアが 2 ~ 5 パーセント 変動する可能性があります。スコアを報告するときは、使用したプロンプトのバージョンを記録する必要があります。記録しないと、結果が比較できなくなります。
  • 少数ショット サンプルのランダム性: 5 ショット評価では、サンプルが選択される順序がモデルのパフォーマンスに影響します。ランダム シードを修正し、複数の実行にわたって平均して、単一のサンプリングの分散を減らすことをお勧めします。
  • デコードパラメータ制御: 評価では、サンプリング戦略によって導入されたランダム性が精度統計に干渉するのを避けるために、貪欲なデコード (温度=0) を使用する必要があります。
  • モデルのトークナイザーの互換性: 一部のモデルのトークナイザーは、中国語の文字をさまざまな方法でセグメント化するため、プロンプトの実際のトークンの長さとトピックのモデルの理解に影響を与える可能性があります。正式な評価の前に、小さなサンプルでプロンプトが正しくエンコードできることを確認することをお勧めします。

CMMLU の製品価格

  • 請求モデル: 完全に無料でオープンソースです。ライセンス料、サブスクリプション料、従量課金制はありません。
  • 含まれる費用: 評価に必要な計算能力はユーザーの負担となります。モデルの規模に応じて、1 回のフルスケール評価の計算能力コストは 1 ~ 30 ドルです (主流のクラウド GPU のオンデマンド価格に基づく)。
  • 企業の民営化: データ セットは完全にオフラインで実行でき、送信データ転送や追加の SaaS 料金は発生しません。
  • 隠し条件なし: GitHub オープン ソース ライセンスは商用利用を制限しませんが、CMMLU スコアを引用する場合は、結果の再現性を保つためにデータ バージョンと評価設定を示す必要があります。

CMMLU の適用シナリオ

  • モデル開発段階での能力診断: 事前トレーニングまたは微調整プロセス中に定期的に CMMLU 評価を実行し、さまざまな主題におけるモデルの能力の変化傾向を監視します。 実際の利点: 特定の被験者の能力低下を早期に検出でき (たとえば、過剰な調整後にモデルが中国の歴史的知識を忘れるなど)、トレーニング データの比率やトレーニング戦略をタイムリーに調整できます。 受け入れフォーカス: チェックポイントが次の段階に進むことができるかどうかのアクセス条件として、被験者レベルの精度しきい値 (たとえば、各被験者がベースライン レベルの 90% を下回ってはなりません) を設定します。

  • モデルリリース時のコンピテンシーステートメント: 中国語の知識熟練度の定量的な証拠として、技術レポートまたはリリース発表で CMMLU スコアを報告します。 実際の利点: 業界内で同等の機能スケールを提供し、ユーザーが選択する際の情報の非対称性を軽減します。 受け入れに関する懸念事項: スコアを報告するときは、評価設定 (ゼロショット/5 ショット、プロンプト バージョン、デコード パラメーター) にも注意する必要があり、同じ条件での C-Eval スコアと MMLU スコアを相互検証のために補足する必要があります。

  • 学術研究とベンチマークの比較: NLP 研究者は、中国語理解の評価ツールとして CMMLU を使用し、このベンチマークでのモデルのパフォーマンスを論文で報告したり、CMMLU に基づいた評価方法の研究 (即時感度分析、データ汚染検出など) を実施したりします。 実際の利点: 中国の NLP 研究に標準化された評価プラットフォームを提供し、新しいモデルや新しい手法の評価コストを削減します。

  • 垂直フィールドモデルの選択評価: 中国の産業(法律、医療、金融など)の大規模モデルを選択する場合、CMMLUの対応する分野(法律、医学、経済など)のスコアが選択の基準次元の1つとして使用されます。 実際の利点: 知識範囲の観点から、対象分野で明らかな利点を持つモデルを迅速に選択でき、テストの範囲を減らすことができます。 合格に関する懸念事項: 関連する科目のスコアのみが参照されるものとし、全体の平均スコアは分野固有の評価の代替として使用されないものとします。

CMMLU の適用可能なグループ

  • 大規模モデル アルゴリズム エンジニアおよび研究者: モデルのトレーニング効果を検証し、能力低下を検出し、さまざまなトレーニング戦略の影響を比較するには、標準化された中国語知識評価が必要です。 CMMLU が提供する科目レベルの診断は、データ割り当ての調整とコース学習の設計を直接ガイドできます。前提条件: モデル推論と基本的な Python スクリプト実行機能を備えていること。

  • NLP 学術研究者: 中国語理解、評価方法論、データ汚染検出などの研究に従事しており、実験プラットフォームとして公的に再現可能な一連のベンチマークが必要です。 CMMLU のオープンソースの性質ときめ細かい主題分割により、実験設計に柔軟性がもたらされます。前提条件: Hugging Face エコシステムと標準評価プロセスに精通していること。

  • モデルの選択および調達の意思決定者: 企業が大規模なモデルを購入する場合、またはオープンソースのモデル ベースを選択する場合、中国語の知識能力の定量的な参照指標の 1 つとして CMMLU スコアを使用します。前提条件: 多肢選択式質問のベンチマークの制限を理解し、それを意思決定の唯一の基準として使用しないことが必要です。

  • ❌こんな人には適さない:

    • 会話、執筆、翻訳などの利用可能な機能に直接アクセスしたいエンド ユーザー。 - CMMLU はレビュー ツールであり、アプリケーション製品ではありません。
    • モデル推論の深さ、創造性、複数ラウンドの対話の質を評価する必要があるシナリオ。これらの次元は、多肢選択式の質問形式では測定できません。
    • モデル選択の際に 1 つの総合スコアのみを参照する意思決定者 - 多肢選択問題のベンチマークはデータ汚染の影響を受け、総合スコアによって主要科目の重大な欠点が隠蔽される可能性があります。他の評価や実測と合わせて総合的に判断する必要があります。

概要と展望

コア コンピテンシー: CMMLU は、67 分野のきめ細かい分割、中国固有の知識の主要なカバー範囲、および完全にオフラインで再現可能なオープンソース アーキテクチャにより、中国の大規模モデル評価環境に不可欠な部分となっています。これは C-Eval を補完し、前者は一般科目の難易度勾配に焦点を当て、後者は中国の地域知識の深さに焦点を当てます。この 2 つの組み合わせにより、モデルの中国語知識能力構造をより完全に特徴付けることができます。

現在の制限事項:

  • データ汚染のリスク: 静的な公開データセットは、トレーニング前の段階でモデルによって簡単に「事前に認識」され、誤って高いスコアが得られます。現在、CMMLU には動的な質問生成や定期的な更新メカニズムがなく、修正バージョンに長期的に依存すると、ますます汚染の問題に直面することになります。
  • 単一質問タイプ: 多肢選択の質問は 4 つだけですが、モデルの生成推論、複数ステップの推論、自由質疑応答の機能を評価することはできません。高いスコアは、記憶された事実の知識の量を反映するだけであり、実際のアプリケーションでのパフォーマンスを保証するものではありません。
  • 科目のカバレッジにはまだギャップがあります: 67 科目はすでに高密度ですが、新興の学際的科目 (AI 倫理、計算社会科学など) や一部の垂直産業 (製薬、金融工学など) ではカバレッジが不十分です。
  • 評価プロトコルの標準化が不十分: 異なるチーム間でのプロンプト テンプレートの数ショット設定と回答抽出の違いにより、スコアは依然として直接比較できません。コミュニティは、より厳格な標準評価プロトコルを必要としています。

経過観察ポイント:

  • CMMLU がデータ汚染と戦うために「プライバシー セット」の動的評価版を開始するかどうか。
  • 実際のタスク評価 (Baichuan-TextEval、SuperCLUE など) に関連付けて変換して、ユーザーがアプリケーション シナリオにおける多肢選択式テストのスコアの実際の意味を理解できるようにすることができますか。
  • コミュニティが CMMLU フレームワークに基づいて垂直産業拡張セット (CMMLU-Med、CMMLU-Law など) を構築するかどうか。
  • 主流モデルのスコアが CMMLU に収束した後、差別化を維持するためにベンチマークの難易度を高めるか、敵対的サンプルを導入する必要があるかどうか。

調達および導入のリスク評価: CMMLU を評価システムに組み込むことを計画しているチームには、次の手順を実行することをお勧めします。短期 (1 ~ 2 週間) で既存の評価パイプラインに統合し、MMLU および C-Eval と同時に実行して、ベースライン比較を確立します。中期 (1 ~ 3 か月) は、トレーニング前のデータ比率調整をガイドするために、CMMLU の被験者レベルの診断出力に焦点を当てます。長期(6 か月以上)で CMMLU データの汚染傾向を厳密に追跡する場合、コミュニティで報告された合理的な範囲を超えるスコアの上昇が観察されるなど、他の異質な評価指標を補足するために考慮する必要があります。商用モデルの性能記述については、一貫性のない評価による誤解を招くモデル選択を避けるために、CMMLU に加えて、同じ条件での MMLU および C-Eval スコアを常に公開し、評価設定 (ショット番号、プロンプト バージョン、デコード パラメーター) を明確に示すことが推奨されます。

関連ツール: hugging-face、replicate

バージョン情報

  • CMMLU 評価ベンチマーク (GitHub オープンソース) :オープンソースの包括的な中国語知識評価ベンチマークは、人文科学、社会科学、科学、工学、および中国語特有の知識における多肢選択式の質問を対象としています。データセット、評価スクリプト、ベースラインスコアを提供します。正式版は倉庫と紙に基づいています。連続するマイナー バージョン番号は個別にリストされていません。日付はおおよその日付です。
  • CMMLU の論文とデータセットが初リリース :データセットと評価プロトコルは論文とともに公開され、対象区分とベースライン評価方法が確立されます。フォローアップは主にウェアハウスの更新と結果の補足に焦点を当てます。当局は正確な日付を明らかにしておらず、日付はおおよその日付である。

ユーザーレビュー

  • レビューを読み込み中...