CMMLU Kostenlos

-

CMMLU ist ein umfassender chinesischer Benchmark zur Bewertung großer Modelle, der Multiple-Choice-Fragen in verschiedenen Bereichen wie Geistes-, Sozial-, Natur- und Ingenieurwissenschaften sowie chinesischspezifisches Wissen abdeckt. Es wird verwendet, um die Wissensreserve und die Argumentationsfähigkeiten großer Sprachmodelle im chinesischen Kontext zu messen. Der Datensatz und der Auswertungscode sind Open Source auf GitHub.

CMMLU Produktoberfläche

CMMLU

Kernparameter und Statistiken von CMMLU

CMMLU (Chinese Massive Multitask Language Understanding) ist eine Reihe von Multi-Domain-Wissensbewertungs-Benchmarks für chinesische große Sprachmodelle, die 2023 von einem akademischen Forschungsteam veröffentlicht werden. Es bietet keine Chat- oder Generierungsfunktionen für Endbenutzer, sondern stellt Forschern und Modellentwicklungsteams eine standardisierte chinesische Wissensfragenbank zur Verfügung, die 67 Disziplinen abdeckt, um die faktische Wissensreserve und die Argumentationsgenauigkeit des Modells im chinesischen Kontext zu messen.

Parameterelement Wert
Vollständiger Name der Benchmark CMMLU (Chinese Massive Multitask Language Understanding)
Gesamtzahl der Fragen ~11.500 Multiple-Choice-Fragen
Themenberichterstattung 67 Disziplinen, unterteilt in vier Kategorien: Geisteswissenschaften, Sozialwissenschaften, Naturwissenschaften und Technik sowie einzigartiges chinesisches Wissen
Optionsstruktur Wählen Sie eine von vier (A/B/C/D)
Fragetyp Wissensbasierte Multiple-Choice-Fragen (Faktengedächtnis + Argumentation und Urteilsvermögen)
Outputindikatoren Genauigkeit jedes Subjekts (Genauigkeit) und durchschnittliche Gesamtgenauigkeit
Lizenzvereinbarung Open Source (GitHub Public Repository)
Erstes Papier arXiv 2023
Bewertungsmethode Lokale Inferenz + Skriptbewertung, unterstützt Wenig-Schuss- und Null-Schuss-Einstellungen
Abhängigkeiten PyTorch / Transformers + Evaluierungsskript

Interpretation der Parameterbedeutung: Die Unterteilungsgranularität von 67 Probanden ist viel feiner als die von MMLU (57 Probanden) und C-Eval (52 Probanden), was bedeutet, dass CMMLU detailliertere Fähigkeitsdiagnosefunktionen in der Subjektdimension bietet. Obwohl die Gesamtzahl von etwa 11.500 Fragen nicht so groß ist wie einige Zehntausend Fragen, reicht die durchschnittliche Dichte von etwa 170 Fragen pro Fach aus, um statistisch signifikante Genauigkeitsvergleiche auf Fachebene zu ermöglichen. Das Vier-Auswahl-Format reduziert die zufällige Schätzungsbasislinie (25 %), sodass das Genauigkeitsintervall von 30 % bis 40 % immer noch einen Unterscheidungswert hat, der zum Auffinden der Mängel des Modells bei schwierigen Themen geeignet ist.

Skalenvergleich mit ähnlichen Benchmarks:

Benchmark Anzahl der Fächer Anzahl der Fragen Sprache Chinaspezifisches Wissen
MMLU 57 ~14.000 Englisch Keine
C-Bewertung 52 ~13.900 Chinesisch Teilweise
CMMLU 67 ~11.500 Chinesisch Schlüsselabdeckung
AGIEval 20+ ~8.000 Chinesisch/Englisch Teilweise

Typbestimmung: CMMLU gehört zur Modellbewertungsinfrastruktur in der Kategorie „Basic Large Model/API Infrastructure“. Das Kernergebnis ist ein Satz standardisierter Datensätze + Bewertungsprotokolle + Basiswerte. Dabei handelt es sich nicht um die kontinuierliche Ausführung von API-Diensten, sondern um eine unverzichtbare Qualitätskontrolle in der Modellentwicklungskette.

Benutzer und Marktbekanntheit von CMMLU

  • Akademische Zitate und Einfluss: Nachdem das CMMLU-Papier auf arXiv veröffentlicht wurde, wurde es von mehreren großen chinesischen Modellteams in technischen Berichten und Papieren als Leistungsbeweis zitiert, einschließlich der Veröffentlichungen von Qwen, Yi, Baichuan, InternLM und anderen Modellreihen, die alle CMMLU-Ergebnisse meldeten. Seit Mitte 2026 hat das GitHub-Repository Tausende von Sternen erhalten und die Community-Fork- und Issue-Diskussionen sind aktiv.

  • Industrial Adoption Model: Große inländische Modellhersteller verwenden im Allgemeinen CMMLU und C-Eval als Standardbewertungskombination für Chinesischkenntnisse. In der Modellfähigkeitsvergleichstabelle sind die Gesamtgenauigkeit von CMMLU und die Genauigkeit jedes einzelnen Subjekts einer der am häufigsten genannten chinesischen Benchmark-Indikatoren. Einige Teams integrieren CMMLU in tägliche Regressionstest-Pipelines, um Leistungsverschlechterungen während des Trainings zu erkennen.

  • Positionierungsunterschied zu C-Eval: C-Eval konzentriert sich auf schwierige Fragen für Chinas College-Aufnahmeprüfung/Postgraduierten-Aufnahmeprüfung in allgemeinen Fächern, während CMMLU sich mehr auf die Berichterstattung über das einzigartige Wissen Chinas (wie chinesische Geschichte, Geographie, Recht, Literatur) konzentriert. Es gibt etwa 60 % Überschneidung zwischen den beiden in der gesamten Fächerverteilung, aber die Tiefe von CMMLU in chinaspezifischen Wissenskategorien ist deutlich höher. Viele Teams melden Ergebnisse für beide Benchmarks gleichzeitig, um ein umfassenderes Bild der Chinesischkenntnisse zu erhalten.

  • Randhinweis: Der Multiple-Choice-Fragen-Benchmark birgt ein inhärentes Risiko der Datenkontamination – das Modell hat möglicherweise den Originaltext der Frage während der Vortrainingsphase gesehen, was zu falsch hohen Punktzahlen führte. Derzeit hat das CMMLU-Team keinen unabhängigen Hold-Out-Datenschutzsatz oder dynamischen Fragegenerierungsmechanismus eingerichtet. Daher muss es bei der Angabe seiner Ergebnisse mit der MMLU/C-Eval-Trendkreuzvalidierung desselben Modellstapels kombiniert werden. Darüber hinaus spiegeln hohe Werte nur den Umfang des Faktenwissens wider und stellen nicht die Argumentationstiefe, die Gesprächsqualität oder die Fähigkeit des Modells dar, Anweisungen zu befolgen.

Kostenvorteile von CMMLU

C-Seite/einzelner Forscher:

  • Keine direkten Kosten: Der Datensatz und das Evaluierungsskript sind vollständig Open Source, und das GitHub-Repository kann direkt geklont und verwendet werden, ohne dass Lizenz- oder Abonnementgebühren anfallen.
  • Laufkosten: Für die Evaluierung ist das Laden des Modells und das Durchführen von Inferenzen auf Ihrer eigenen Hardware oder Cloud-Instanz erforderlich. Am Beispiel eines 7B-Parameterskalenmodells dauert es etwa 30 bis 60 Minuten, um die Inferenz für alle 67 Probanden auf einem einzigen A100 abzuschließen, und die entsprechenden Cloud-Computing-Kosten betragen etwa 1 bis 3 US-Dollar (geschätzt auf der Grundlage von On-Demand-Preisen). Die für ein Modell im Maßstab 70B+ erforderliche Rechenleistung steigt linear an und die geschätzten Kosten für eine einzelne vollständige Auswertung liegen im Bereich von 10 bis 30 US-Dollar.

API-Entwickler/Modelldienstleister:

  • Selbst erstellter alternativer Kostenvergleich: Wenn Sie einen chinesischen Bewertungssatz von Grund auf erstellen, der 67 Fächer und etwa 170 Fragen in jedem Fach abdeckt, müssen Sie Fachexperten einstellen, um die Fragen zu entwickeln, zu überprüfen, zu testen und zu kalibrieren. Die geschätzten Arbeitskosten belaufen sich auf Hunderttausende Yuan. CMMLU reduziert diese Kosten auf Null, indem es validierte Fragenbanken und Baselines direkt und ohne Lizenzgebühren bereitstellt.
  • Integrationskosten: Das Evaluierungsskript basiert auf den Hugging Face-Transformatoren und Datensatzbibliotheken und ist natürlich mit gängigen Modell-Frameworks kompatibel, ohne dass zusätzliche Anpassungen erforderlich sind. Die technischen Kosten für die Integration der CMMLU-Bewertung in eine Modelltrainingspipeline liegen in der Regel bei 1–2 Manntagen.

Unternehmen/Institution:

  • Private Bereitstellung: Der Datensatz kann vollständig offline verwendet werden und ist nicht auf eine externe API angewiesen, um Datensicherheits- und Compliance-Anforderungen zu erfüllen. Die Auswertungsergebnisse verlassen nicht den lokalen Bereich und eignen sich für Branchen wie Finanzen, Medizin und Regierungsangelegenheiten, in denen strenge Beschränkungen für den Datenexport gelten.
  • Versteckte Kosten - Konsistenz des Bewertungsprotokolls: Kleine Unterschiede zwischen verschiedenen Teams in der Stichprobenauswahl der Eingabeaufforderungsvorlage mit wenigen Schüssen und der Antwortextraktionslogik können zu Bewertungsabweichungen von 3–5 Prozentpunkten führen. Um horizontal vergleichbare Ergebnisse zu erhalten, müssen die offiziell empfohlenen Bewertungsparameter (Zero-Shot oder 5-Shot, einheitliches Eingabeaufforderungsformat) strikt umgesetzt werden. Wenn die Protokolle nicht harmonisiert sind, sind die gemeldeten Ergebnisse möglicherweise nicht vergleichbar.

Hauptfunktionen von CMMLU

  • Multidisziplinäre standardisierte Fragendatenbank: Deckt 67 Themen ab und ist in vier Kategorien unterteilt: Geisteswissenschaften (chinesische Literatur, Geschichte, Philosophie usw.), Sozialwissenschaften (Recht, Wirtschaft, Bildung usw.), Naturwissenschaften und Ingenieurwesen (Mathematik, Physik, Computer usw.) und chinesischspezifisches Wissen (chinesische Politik, chinesische Geographie, chinesische Folklore usw.). Es gibt ungefähr 170 Fragen in jedem Fach, ein Vier-Auswahl-Format und eine zufällige Basis von 25 %. Verwendungswert: Stellen Sie eine standardisierte Messskala für Chinesischkenntnisse bereit, um verschiedene Modelle auf derselben Skala vergleichbar zu machen.

  • Flexibles Evaluierungsframework: Unterstützt zwei Evaluierungseinstellungen: Zero-Shot und Few-Shot (Standard 5-Shot). Die Eingabeaufforderungsvorlage sowie die Anzahl und Reihenfolge der Beispiele können angepasst werden, um sie an den optimalen Leistungsbereich verschiedener Modelle anzupassen. Nutzungswert: Das Team kann basierend auf dem Modelltyp (Basis- vs. Befehls-Feinabstimmung) die am besten geeigneten Bewertungseinstellungen auswählen, um Abweichungen zu vermeiden, die durch einen einzelnen Stil verursacht werden.

  • Open-Source-Basisergebnisse: Das Warehouse hat die Genauigkeitsbasislinien mehrerer Mainstream-Modelle in verschiedenen Disziplinen offengelegt, darunter GPT-4, Claude, Qwen, Baichuan, InternLM, Yi und andere Serien. Nutzungswert: Das neue Modellteam kann das Leistungsniveau direkt anhand der Basislinie beurteilen, ohne ein Referenzsystem von Grund auf erstellen zu müssen.

  • Fähigkeitsdiagnose auf Subjektebene: Das Bewertungsskript gibt die unabhängige Genauigkeitsrate jedes Subjekts aus und kann automatisch ein Radardiagramm oder Histogramm für den horizontalen Vergleich erstellen. Wert verwenden: Lokalisieren Sie genau die Fächer, in denen das Modell stark (z. B. chinesische Geschichte, Literatur) und schwach (z. B. fortgeschrittene Mathematik, Physik) ist, und stellen Sie eine quantitative Grundlage für den Datenabgleich und die Anpassung der Trainingsstrategie bereit.

  • Community-Skalierbarkeit: Der Datensatz und der Code sind vollständig für die Öffentlichkeit zugänglich. Das Forschungsteam kann Themen hinzufügen oder löschen, die Fragen ändern, neue Modellbasislinien hinzufügen oder Schnittstellen aus den Bewertungsskripten extrahieren und sie in benutzerdefinierte Testpipelines einbetten. Nutzungswert: Teams, die auf bestimmte Branchen (z. B. Recht, Medizin) abzielen, können auf CMMLU basierende vertikale Feldbewertungssätze erstellen und die vorgefertigte Bewertungstoolkette wiederverwenden.

Expertenmeinung: Die „Diagnose auf Subjektebene“ und der „Baseline-Vergleich“ von CMMLU hängen zusammen – die Baseline bietet einen Referenzrahmen und die Subjektbewertung lokalisiert Mängel. Die Kombination beider ermöglicht es dem Modellteam, sich nicht mehr ausschließlich auf die Gesamtpunktzahl zu verlassen, um die Qualität des Modells zu messen, sondern kann präzise sagen, „welches Subjekt um X Prozentpunkte schlechter ist“. Dieser Link hat eine direkte Leitbedeutung für die Optimierung des Trainingsdatenverhältnisses, die Gestaltung von Kurslernstrategien und die Datenauswahl zur Domänenerweiterung und Feinabstimmung.

Modell- und Versionsentwicklung von CMMLU

Mainline-Veröffentlichung

  • Erste Version des Papiers (2023-06): Zusammen mit dem öffentlichen Datensatz des arXiv-Papiers v1.0 und der Bewertungsvereinbarung werden 67 Fachabteilungen und 5-Schuss-Bewertungsspezifikationen festgelegt. Das Papier berichtet auch über die Basisergebnisse von GPT-4, ChatGPT und mehreren frühen chinesischen Modellen. Dies ist der erste Meilenstein für CMMLU und alle nachfolgenden Updates basieren auf dieser Version.

  • Datensatzaktualisierung (~2024): Basierend auf Community-Feedback wurden Fragenfehler und Probleme mit der Antwortkennzeichnung in einigen Fächern korrigiert und eine kleine Anzahl neuer Fachfragen hinzugefügt. Die offizielle Versionsnummer wird nicht separat aufgeführt und der Update-Datensatz unterliegt dem GitHub-Commit-Log. Änderungen: Etwa Dutzende Fehler wurden korrigiert und die Gesamtzahl der Probanden bleibt unverändert bei 67.

  • Kontinuierlicher Wartungszeitraum (2024 bis heute): Das Warehouse verwendet Issues, um Problemberichte und Vorschläge zu verwalten, die von der Community zurückgesendet werden, und führt regelmäßig PRs zusammen und korrigiert sie. Die Baseline-Score-Tabelle wird kontinuierlich aktualisiert, wenn neue Modelle veröffentlicht werden, strukturelle Änderungen an der Datensatz-Ontologie sind jedoch tendenziell stabil. Änderungspunkte: Die Anzahl der Basismodelle nimmt weiter zu und die Kernstruktur des Datensatzes wurde nicht wesentlich geändert.

Wichtige Punkte des Versionskontexts

Die Versionsentwicklungsfunktion von CMMLU ist das akademische Benchmark-Modell „einmalige Veröffentlichung des Datensatzes + kontinuierliche Aktualisierung der Basislinie“, das sich von der semantischen Versionsverwaltung kommerzieller Produkte unterscheidet. Der Datensatz selbst wurde seit seiner Veröffentlichung nur auf Errat-Ebene überarbeitet und hat keine strukturellen Erweiterungen oder Versionsnummernsprünge erfahren. Beim Zitieren sind das Veröffentlichungsdatum des Artikels und der GitHub-Commit-Hash maßgebend.

Versionsmeilenstein Datum Kernänderungen
Erste Veröffentlichung des Papiers ~2023-06 Öffentlicher 67-Probanden-Datensatz v1.0, Bewertungsskript, Basiswerte
Errata-Update ~2024 Einige Fragenfehler korrigiert, Betreffzeilen ergänzt, kein Versionsnummernsprung
Kontinuierliche Wartung 2024 bis heute Das Basismodell wird weiter ausgebaut und die Datensatzstruktur bleibt stabil

Technische Vorteile von CMMLU

Mechanismus: CMMLU übernimmt die Offline-Bewertungsarchitektur „statischer Datensatz + lokales Bewertungsskript“. Der Datensatz speichert den Fragenstamm, vier Optionen und den richtigen Antwortindex jeder Frage im JSON-Format; Das Bewertungsskript liest nacheinander die Fragen, erstellt Eingabeaufforderungen, ruft Modellbegründungen auf, vergleicht Antworten und zählt die Genauigkeit pro Thema.

Wirkung:

  • Vollständig offline reproduzierbar: Die gesamte Auswertungslogik wird lokal ausgeführt und ist nicht auf externe Dienste angewiesen. Jedes Team, das dieselbe Version des Datensatzes und Skripts verwendet, kann konsistente Ergebnisse erzielen. Dadurch wird die Beeinträchtigung der Ergebnisse durch unkontrollierbare Faktoren wie API-Versionsunterschiede, Service-Updates und Zufallsstichproben bei Online-Bewertungen eliminiert.

  • Feinkörnige Probandendiagnose: Die Granularität von 67 Probanden steht im Vordergrund der chinesischen Bewertungsmaßstäbe. Beim Vergleich der 57 Fächer von MMLU mit den 52 Fächern von C-Eval hat CMMLU eine große Anzahl von Unterteilungen (z. B. chinesisches politisches System, chinesische Folklore, alte chinesische Geschichte usw.) zur Kategorie „Chinesisch-spezifisches Wissen“ hinzugefügt, sodass die Beherrschung des lokalen chinesischen Wissens durch das Modell individuell gemessen werden kann.

  • Komplementäres Design mit MMLU: Die Themensetzung von CMMLU und MMLU hängt nicht nur mit der Chinesisch-Englisch-Übersetzung zusammen. Die von MMLU abgedeckten Disziplinen basieren auf dem westlichen Wissenssystem, während CMMLU eine große Anzahl von Wissens- und Bewertungsdimensionen hinzufügt, die nur in China vorkommen. Durch die gleichzeitige Ausführung von MMLU und CMMLU auf demselben Modell kann der Unterschied in den beiden Dimensionen „Fähigkeit allgemeines Wissen“ und „Fähigkeit kontextbezogenes Chinesisch“ getrennt werden. Beispielsweise kann ein Modell, das bei MMLU eine gute Leistung erbringt, in der Kategorie „China-spezifisches Wissen“ von CMMLU schlecht abschneiden, was darauf hindeutet, dass das Modell die chinesische Kultur in den chinesischen Daten vor dem Training nicht ausreichend abdeckt.

Anwendbare Szenarien: CMMLU eignet sich eher als Fähigkeitsdiagnosetool in der Modellentwicklungsphase und nicht als endgültiger Publizitätsindikator vor der Veröffentlichung. Durch die regelmäßige Durchführung der CMMLU-Bewertung während des Trainingsprozesses kann die Verschlechterung der Fähigkeiten des Modells in bestimmten Fächern (z. B. das durch Überausrichtung verursachte Vergessen von Faktenwissen) sofort erkannt werden. Für die Veröffentlichung von Berichten wird empfohlen, CMMLU mit C-Eval, MMLU, AGIEval usw. zu kombinieren, um eine Bewertungssuite zu bilden, um eine Überinterpretation der Ergebnisse eines einzelnen Benchmarks zu vermeiden.

So verwenden Sie CMMLU

Eingangskontrolle:

Eingang Zweck Kosten
GitHub-Repository (haonan-li/CMMLU) Datensatz-Download, Auswertungsskript, Basisergebnisse, Dokumentation Kostenlos
arXiv-Papier Methodenbeschreibung, Themendefinition, frühe Baseline Kostenlos
Umarmende Gesichtsdatensätze Laden Sie CMMLU direkt über die Datensatzbibliothek Kostenlos

Typische Schritte:

  1. Den Datensatz abrufen: git clone https://github.com/haonan-li/CMMLU.git, oder laden Sie ihn direkt über datasets.load_dataset("haonan-li/cmmlu").
  2. Bereiten Sie das Modell vor: Stellen Sie sicher, dass das auszuwertende Modell über AutoModelForCausalLM von Hugging Face-Transformatoren geladen werden kann, oder implementieren Sie eine kompatible Inferenzschnittstelle.
  3. Bewertung ausführen: Führen Sie das Bewertungsskript aus, geben Sie den Modellpfad, die Bewertungseinstellungen (Zero-Shot oder 5-Shot), das Ausgabeverzeichnis und andere Parameter an. Beispielbefehl: „python eval.py --model Qwen/Qwen2-7B --shot 5 --output ./results“.
  4. Ergebnisse anzeigen: Das Skript gibt die Genauigkeitsrate jedes Probanden und die durchschnittliche Gesamtgenauigkeitsrate aus und generiert außerdem ein visuelles Vergleichsdiagramm zwischen Probanden.

Anpassungstipps:

  • Das Eingabeaufforderungsformat muss einheitlich sein: Unterschiedliche Eingabeaufforderungsvorlagen (z. B. ob eine Rollenbeschreibung hinzugefügt werden soll oder ob chinesische Befehlspräfixe verwendet werden sollen) können dazu führen, dass die Punktzahl um 2–5 Prozentpunkte schwankt. Bei der Meldung der Ergebnisse muss die verwendete Eingabeaufforderungsversion vermerkt werden, andernfalls sind die Ergebnisse nicht vergleichbar.
  • Zufälligkeit von wenigen Stichproben: Bei der 5-Schuss-Auswertung wirkt sich die Reihenfolge, in der die Stichproben ausgewählt werden, auf die Modellleistung aus. Es wird empfohlen, den Zufallsstartwert festzulegen und ihn über mehrere Durchläufe zu mitteln, um die Varianz einer einzelnen Stichprobe zu verringern.
  • Dekodierungsparametersteuerung: Die Auswertung sollte eine gierige Dekodierung (Temperatur=0) verwenden, um zu verhindern, dass durch die Stichprobenstrategie verursachte Zufälligkeiten die Genauigkeitsstatistik beeinträchtigen.
  • Modell-Tokenizer-Kompatibilität: Die Tokenizer einiger Modelle segmentieren chinesische Zeichen auf unterschiedliche Weise, was sich auf die tatsächliche Tokenlänge der Eingabeaufforderung und das Verständnis des Modells für das Thema auswirken kann. Es wird empfohlen, vor der formellen Auswertung anhand einer kleinen Stichprobe zu überprüfen, ob die Eingabeaufforderung korrekt kodiert werden kann.

Produktpreise für CMMLU

  • Abrechnungsmodell: Völlig kostenlos und Open Source. Keine Lizenzgebühren, keine Abonnementgebühren, kein Pay-per-Use.
  • Inklusivkosten: Die zur Auswertung erforderliche Rechenleistung trägt der Nutzer. Abhängig vom Maßstab des Modells liegen die Kosten für die Rechenleistung für eine einzelne vollständige Evaluierung zwischen 1 und 30 US-Dollar (basierend auf den On-Demand-Preisen für gängige Cloud-GPUs).
  • Unternehmensprivatisierung: Datensätze können vollständig offline ausgeführt werden, ohne ausgehende Datenübertragung und ohne zusätzliche SaaS-Gebühren.
  • Keine versteckten Begriffe: Die GitHub-Open-Source-Lizenz schränkt die kommerzielle Nutzung nicht ein, aber beim Zitieren von CMMLU-Scores müssen die Datenversion und die Auswertungseinstellungen angegeben werden, um die Ergebnisse reproduzierbar zu halten.

Anwendungsszenarien von CMMLU

  • Fähigkeitsdiagnose in der Modellentwicklungsphase: Führen Sie während des Vortrainings- oder Feinabstimmungsprozesses regelmäßig eine CMMLU-Bewertung durch, um die sich ändernden Trends der Modellfähigkeiten in verschiedenen Themen zu überwachen. Tatsächliche Vorteile: Eine Verschlechterung der Fähigkeiten in bestimmten Fächern kann frühzeitig erkannt werden (z. B. vergisst das Modell chinesisches historisches Wissen nach einer Überausrichtung) und das Trainingsdatenverhältnis oder die Trainingsstrategie können rechtzeitig angepasst werden. Akzeptanzfokus: Legen Sie einen Genauigkeitsschwellenwert auf Subjektebene fest (z. B. sollte jedes Subjekt nicht unter 90 % des Basisniveaus liegen) als Zugriffsbedingung dafür, ob der Prüfpunkt in die nächste Stufe eintreten kann.

  • Kompetenzerklärung bei Model Release: Geben Sie CMMLU-Ergebnisse in technischen Berichten oder Release-Ankündigungen als quantitativen Nachweis der Chinesischkenntnisse an. Tatsächliche Vorteile: Stellen Sie einen vergleichbaren Leistungsumfang innerhalb der Branche bereit und reduzieren Sie die Informationsasymmetrie, wenn Benutzer eine Auswahl treffen. Akzeptanzbedenken: Bei der Meldung von Ergebnissen müssen auch die Bewertungseinstellungen (Zero-Shot/5-Shot, Prompt-Version, Dekodierungsparameter) beachtet werden und C-Eval- und MMLU-Scores unter denselben Bedingungen müssen zur Kreuzvalidierung ergänzt werden.

  • Akademische Forschung und Benchmark-Vergleich: NLP-Forscher verwenden CMMLU als Bewertungstool für das Verständnis der chinesischen Sprache, berichten in Aufsätzen über die Leistung des Modells bei diesem Benchmark oder führen auf CMMLU basierende Forschung zu Bewertungsmethoden durch (z. B. sofortige Sensitivitätsanalyse, Erkennung von Datenverschmutzung usw.). Tatsächliche Vorteile: Bereitstellung einer standardisierten Bewertungsplattform für die chinesische NLP-Forschung und Reduzierung der Bewertungskosten neuer Modelle und neuer Methoden.

  • Bewertung der Auswahl vertikaler Feldmodelle: Bei der Auswahl großer Modelle in chinesischen Branchen (Recht, Medizin, Finanzen usw.) werden die Ergebnisse der entsprechenden Disziplinen (wie Recht, Medizin, Wirtschaft) in CMMLU als eine der Referenzdimensionen für die Auswahl verwendet. Tatsächlicher Nutzen: Aus Sicht der Wissensabdeckung können Modelle mit offensichtlichen Vorteilen im Zielfeld schnell ausgewählt und der Testumfang reduziert werden. Akzeptanzbedenken: Es dürfen nur relevante Fachergebnisse herangezogen werden, und die durchschnittliche Gesamtpunktzahl darf nicht als Ersatz für eine fachspezifische Bewertung verwendet werden.

Anwendbare Gruppen von CMMLU

  • Ingenieur und Forscher für große Modellalgorithmen: Eine standardisierte Bewertung des Chinesischwissens ist erforderlich, um den Effekt des Modelltrainings zu überprüfen, Leistungsverschlechterungen zu erkennen und die Auswirkungen verschiedener Trainingsstrategien zu vergleichen. Die von CMMLU bereitgestellte Diagnose auf Fachebene kann die Anpassung der Datenzuordnung und das Kurslerndesign direkt steuern. Voraussetzungen: Sie verfügen über Modellargumentation und grundlegende Fähigkeiten zur Ausführung von Python-Skripten.

  • Akademischer NLP-Forscher: Da er sich mit der Erforschung des chinesischen Sprachverständnisses, der Bewertungsmethodik, der Erkennung von Datenverschmutzung usw. beschäftigt, ist eine Reihe öffentlich reproduzierbarer Benchmarks als experimentelle Plattform erforderlich. Der Open-Source-Charakter und die feinkörnige Themenaufteilung von CMMLU bieten Flexibilität bei der experimentellen Gestaltung. Voraussetzung: Vertraut mit dem Hugging Face-Ökosystem und dem Standardbewertungsprozess.

  • Entscheider für Modellauswahl und Beschaffung: Wenn Unternehmen große Modelle kaufen oder Open-Source-Modellbasen auswählen, verwenden Sie den CMMLU-Score als einen der quantitativen Referenzindikatoren für chinesische Wissenskapazitäten. Voraussetzung: Es ist notwendig, die Grenzen des Multiple-Choice-Fragen-Benchmarks zu verstehen und ihn nicht als alleinige Entscheidungsgrundlage zu verwenden.

  • ❌ Nicht für Menschen geeignet:

    • Endbenutzer, die direkten Zugriff auf verfügbare Funktionen wie Konversation, Schreiben, Übersetzen usw. wünschen. - CMMLU ist ein Überprüfungstool und kein Anwendungsprodukt.
    • Szenarien, die eine Bewertung der Tiefe des Modellarguments, der Kreativität und der Qualität mehrerer Dialogrunden erfordern – Dimensionen, die das Multiple-Choice-Fragenformat nicht messen kann.
    • Entscheidungsträger, die sich bei der Modellauswahl nur auf eine einzige Gesamtpunktzahl stützen – der Multiple-Choice-Fragen-Benchmark wird durch Datenkontamination beeinträchtigt und die Gesamtpunktzahl kann schwerwiegende Mängel in Schlüsselfächern verdecken. Eine umfassende Beurteilung muss in Verbindung mit anderen Bewertungen und tatsächlichen Messungen erfolgen.

Zusammenfassung und Ausblick

Kernkompetenzen: CMMLU ist mit seiner feinkörnigen Aufteilung in 67 Disziplinen, der Schlüsselabdeckung von China-spezifischem Wissen und der vollständig offline reproduzierbaren Open-Source-Architektur zu einem unverzichtbaren Bestandteil der chinesischen Evaluierungslandschaft für große Modelle geworden. Es ergänzt C-Eval – ersteres konzentriert sich auf den Schwierigkeitsgrad allgemeiner Fächer und letzteres auf die Tiefe des chinesischen Lokalwissens – und die Kombination der beiden kann die Fähigkeitsstruktur des chinesischen Wissens des Modells vollständiger charakterisieren.

Aktuelle Einschränkungen:

  • Datenverschmutzungsrisiko: Statische öffentliche Datensätze werden vom Modell während der Vortrainingsphase leicht „im Voraus gesehen“, was zu falsch hohen Punktzahlen führt. Derzeit verfügt CMMLU weder über eine dynamische Fragengenerierung noch über einen regelmäßigen Aktualisierungsmechanismus, und die langfristige Abhängigkeit von festen Versionen wird immer mehr Verschmutzungsproblemen gegenüberstehen.
  • Einzelfragetyp: Es gibt nur vier Multiple-Choice-Fragen, die das generative Denken, das mehrstufige Denken und die offenen Frage- und Antwortfunktionen des Modells nicht bewerten können. Hohe Punktzahlen spiegeln lediglich die Menge des gelernten Sachwissens wider und sind keine Garantie für die Leistung in der praktischen Anwendung.
  • Es gibt immer noch Lücken in der Fachabdeckung: Obwohl die 67 Fächer bereits eine hohe Dichte aufweisen, ist die Abdeckung in aufstrebenden interdisziplinären Fächern (wie KI-Ethik, Computational Social Sciences) und einigen vertikalen Branchen (wie Pharmazie, Finanztechnik) unzureichend.
  • Unzureichende Standardisierung der Bewertungsprotokolle: Unterschiede in den Einstellungen der Eingabeaufforderungsvorlage für wenige Schüsse und der Antwortextraktion zwischen verschiedenen Teams führen immer noch zu Ergebnissen, die nicht direkt vergleichbar sind. Die Community benötigt ein strengeres Standard-Bewertungsprotokoll.

Folgebeobachtungspunkte: – Ob CMMLU eine dynamische Evaluierungsversion von „Privacy Set“ herausbringen wird, um die Datenverschmutzung zu bekämpfen.

  • Kann es mit realen Aufgabenbewertungen (wie Baichuan-TextEval, SuperCLUE) verknüpft und transformiert werden, um Benutzern das Verständnis der tatsächlichen Bedeutung von Multiple-Choice-Testergebnissen in Anwendungsszenarien zu erleichtern?
  • Ob die Community vertikale Branchenerweiterungssätze (wie CMMLU-Med, CMMLU-Law) basierend auf dem CMMLU-Framework erstellen wird.
  • Nachdem die Ergebnisse der Mainstream-Modelle auf CMMLU konvergiert sind, wird festgestellt, ob der Benchmark den Schwierigkeitsgrad erhöhen oder gegnerische Stichproben einführen muss, um die Diskriminierung aufrechtzuerhalten.

Beschaffungs- und Einführungsrisikobewertung: Für Teams, die planen, CMMLU in das Bewertungssystem zu integrieren, wird empfohlen, die folgenden Schritte zu unternehmen: kurzfristige (1-2 Wochen) Integration in die bestehende Bewertungspipeline, gleichzeitige Ausführung mit MMLU und C-Eval und Erstellung eines Basisvergleichs; mittelfristig (1–3 Monate) Fokus auf die diagnostische Ausgabe von CMMLU auf Subjektebene, um die Anpassung des Datenverhältnisses vor dem Training zu steuern; Langfristige (mehr als 6 Monate) genaue Verfolgung von CMMLU-Datenkontaminationstrends, wie z. B. die beobachtete, von der Community gemeldete Score-Inflation, die einen angemessenen Bereich überschreitet, sollte als Ergänzung zu anderen heterogenen Bewertungsindikatoren in Betracht gezogen werden. Für die Fähigkeitserklärung eines kommerziellen Modells wird empfohlen, zusätzlich zur CMMLU immer die MMLU- und C-Eval-Scores unter denselben Bedingungen offenzulegen und die Bewertungseinstellungen (Schussnummer, Eingabeaufforderungsversion, Decodierungsparameter) klar anzugeben, um eine irreführende Modellauswahl aufgrund inkonsistenter Bewertungen zu vermeiden.

Verwandte Tools: hugging-face, replicate

Versionsinfo

  • CMMLU-Bewertungsbenchmark (GitHub Open Source) :Der Open-Source-Benchmark zur umfassenden Beurteilung des chinesischen Wissens umfasst Multiple-Choice-Fragen in den Geistes-, Sozial-, Natur- und Ingenieurwissenschaften sowie chinesischspezifischem Wissen. Es stellt Datensätze, Bewertungsskripte und Baseline-Scores bereit. Die offizielle Version basiert auf dem Lager und dem Papier. Die fortlaufenden Nebenversionsnummern werden nicht separat aufgeführt. Die Daten sind ungefähre Angaben.
  • CMMLU-Papier und Datensatz erstmals veröffentlicht :Der Datensatz und das Bewertungsprotokoll werden mit der Arbeit offengelegt, und die Themenaufteilung und die grundlegende Bewertungsmethode werden festgelegt. Das Follow-up wird sich hauptsächlich auf Lageraktualisierungen und Ergebnisergänzungen konzentrieren. Der Beamte hat das genaue Datum nicht bekannt gegeben, und das Datum ist eine Annäherung.

Benutzerbewertungen

  • Bewertungen werden geladen...