CMMLU
Gratuit
CMMLU est une référence complète d'évaluation de grands modèles chinois, couvrant des questions à choix multiples dans plusieurs domaines tels que les sciences humaines, les sciences sociales, les sciences et l'ingénierie, ainsi que les connaissances spécifiques à la Chine. Il est utilisé pour mesurer la réserve de connaissances et les capacités de raisonnement de grands modèles linguistiques dans le contexte chinois. L'ensemble de données et le code d'évaluation sont open source sur GitHub.
CMMLU
Paramètres de base et statistiques de CMMLU
CMMLU (Chinese Massive Multitask Language Understanding) est un ensemble de critères d'évaluation des connaissances multi-domaines pour les grands modèles linguistiques chinois, qui seront publiés par une équipe de recherche universitaire en 2023. Il ne fournit pas de fonctions de discussion ou de génération pour les utilisateurs finaux, mais fournit aux chercheurs et aux équipes de développement de modèles une banque de questions de connaissances chinoises standardisée couvrant 67 disciplines pour mesurer la réserve de connaissances factuelles et l'exactitude du raisonnement du modèle dans le contexte chinois.
| Élément de paramètre | Valeur |
|---|---|
| Nom complet de l'indice de référence | CMMLU (Compréhension du langage multitâche massif chinois) |
| Nombre total de questions | ~11 500 questions à choix multiples |
| Couverture du sujet | 67 disciplines, réparties en quatre catégories : sciences humaines, sciences sociales, sciences et ingénierie et savoir unique chinois |
| Structure des options | Choisissez l'un des quatre (A/B/C/D) |
| Type de question | Questions à choix multiples basées sur les connaissances (mémoire des faits + raisonnement et jugement) |
| Indicateurs de résultats | Précision de chaque sujet (Précision) et précision moyenne globale |
| Contrat de licence | Open Source (dépôt public GitHub) |
| Premier article | arXiv 2023 |
| Méthode d'évaluation | Inférence locale + notation de script, prenant en charge les paramètres de quelques tirs et de zéro tir |
| Dépendances | PyTorch / Transformateurs + Script d'évaluation |
Interprétation de la signification des paramètres : La granularité de division de 67 sujets est beaucoup plus fine que celle de MMLU (57 sujets) et C-Eval (52 sujets), ce qui signifie que CMMLU fournit des capacités de diagnostic de capacité plus fines dans la dimension du sujet. Bien que le nombre total d'environ 11 500 questions ne soit pas aussi important que quelques dizaines de milliers de questions, la densité moyenne d'environ 170 questions par sujet est suffisante pour permettre des comparaisons d'exactitude statistiquement significatives au niveau du sujet. Le format à quatre choix réduit la ligne de base des suppositions aléatoires (25 %), de sorte que l'intervalle de précision de 30 % à 40 % a toujours une valeur discriminante, ce qui convient pour localiser les lacunes du modèle dans des sujets difficiles.
Comparaison d'échelle avec des références similaires :
| Référence | Nombre de sujets | Nombre de questions | Langue | Connaissances spécifiques à la Chine |
|---|---|---|---|---|
| MMLU | 57 | ~14 000 | Anglais | Aucun |
| C-Eval | 52 | ~13 900 | Chinois | Partielle |
| CMMLU | 67 | ~11 500 | Chinois | Couverture clé |
| AGIEval | 20+ | ~8 000 | Chinois/Anglais | Partielle |
Détermination du type : CMMLU appartient à l'infrastructure d'évaluation de modèle dans la catégorie "Basic Large Model/API Infrastructure". Le livrable principal est un ensemble d’ensembles de données standardisés + protocoles d’évaluation + scores de base. Cela n’implique pas l’exécution continue de services API, mais il s’agit d’un contrôle de qualité indispensable dans la chaîne de développement de modèles.
Utilisateurs et reconnaissance du marché de CMMLU
-
Citations académiques et influence : après que l'article CMMLU a été rendu public sur arXiv, il a été cité par plusieurs grandes équipes chinoises de modèles dans des rapports et articles techniques comme preuve de capacités, y compris les versions de Qwen, Yi, Baichuan, InternLM et d'autres séries de modèles qui ont tous rapporté des scores CMMLU. Depuis la mi-2026, son référentiel GitHub a reçu des milliers d'étoiles, et les discussions communautaires et les problèmes sont actifs.
-
Modèle d'adoption industrielle : les grands fabricants de modèles nationaux utilisent généralement CMMLU et C-Eval comme combinaison d'évaluation standard pour les connaissances en chinois. Dans le tableau de comparaison des capacités du modèle, la précision globale du CMMLU et la précision de chaque sujet sont l'un des indicateurs de référence chinois les plus fréquemment cités. Certaines équipes intègrent CMMLU dans les pipelines de tests de régression quotidiens pour détecter la dégradation des capacités pendant la formation.
-
Différence de positionnement avec C-Eval : C-Eval se concentre sur les questions difficiles de l'examen d'entrée à l'université/examen d'entrée de troisième cycle en Chine dans les matières générales, tandis que CMMLU se concentre davantage sur la couverture des connaissances uniques de la Chine (telles que l'histoire, la géographie, le droit et la littérature chinoises). Il y a environ 60 % de chevauchement entre les deux dans la répartition globale des sujets, mais la profondeur du CMMLU dans les catégories de connaissances spécifiques à la Chine est nettement plus élevée. De nombreuses équipes communiquent simultanément leurs scores sur les deux critères pour obtenir une image plus complète de la maîtrise du chinois.
-
Remarque sur les limites : le test de référence des questions à choix multiples présente un risque inhérent de contamination des données : le modèle peut avoir vu le texte original de la question pendant la phase de pré-formation, ce qui a entraîné des scores faussement élevés. À l'heure actuelle, l'équipe CMMLU n'a pas établi d'ensemble indépendant de confidentialité ni de mécanisme de génération de questions dynamiques. Par conséquent, lorsqu'elle cite ses scores, il doit être combiné avec la validation croisée de tendance MMLU/C-Eval du même lot de modèles. De plus, les scores élevés reflètent uniquement la quantité de connaissances factuelles et ne représentent pas la profondeur du raisonnement du modèle, la qualité de la conversation ou la capacité à suivre les instructions.
Avantages de coût de CMMLU
Côté C/chercheur individuel :
- Zéro coût direct : l'ensemble de données et le script d'évaluation sont entièrement open source, et le référentiel GitHub peut être directement cloné et utilisé sans payer de frais de licence ou d'abonnement.
- Coût de fonctionnement : l'évaluation nécessite le chargement du modèle et l'exécution d'une inférence sur votre propre matériel ou instance cloud. En prenant comme exemple un modèle à l'échelle de paramètres 7B, il faut environ 30 à 60 minutes pour effectuer une inférence pour les 67 sujets sur un seul A100, et le coût du cloud computing correspondant est d'environ 1 à 3 $ (estimé sur la base d'une tarification à la demande). La puissance de calcul requise pour un modèle à l'échelle 70B+ augmente de manière linéaire, et le coût estimé d'une seule évaluation à grande échelle se situe entre 10 et 30 dollars.
Développeur d'API/fournisseur de services de modèles :
- Comparaison des coûts alternatifs auto-construite : si vous créez un ensemble d'évaluation chinois à partir de zéro couvrant 67 sujets et environ 170 questions dans chaque sujet, vous devez embaucher des experts en la matière pour développer, réviser, tester et calibrer les questions. Le coût de la main-d'œuvre est estimé à plusieurs centaines de milliers de yuans. CMMLU réduit ce coût à zéro en fournissant directement des banques de questions et des lignes de base validées sans frais de licence.
- Coût d'intégration : Le script d'évaluation est basé sur les bibliothèques de transformateurs et d'ensembles de données Hugging Face, et est naturellement compatible avec les frameworks de modèles traditionnels sans nécessiter d'adaptation supplémentaire. Le coût d'ingénierie de l'intégration de l'évaluation CMMLU dans un pipeline de formation modèle est généralement de 1 à 2 jours-homme.
Entreprise/Institution :
- Déploiement privé : l'ensemble de données peut être utilisé entièrement hors ligne et ne repose sur aucune API externe pour répondre aux exigences de sécurité et de conformité des données. Les résultats de l'évaluation ne quittent pas la zone locale et conviennent aux secteurs tels que la finance, la médecine et les affaires gouvernementales qui appliquent des restrictions strictes sur l'exportation de données.
- Coût caché - Cohérence du protocole d'évaluation : de petites différences entre les différentes équipes dans la sélection d'échantillons en quelques étapes du modèle d'invite et la logique d'extraction des réponses peuvent entraîner des écarts de score de 3 à 5 points de pourcentage. Afin d'obtenir des résultats horizontalement comparables, les paramètres d'évaluation officiellement recommandés (zéro-shot ou 5-shot, format d'invite unifié) doivent être strictement mis en œuvre. Lorsque les protocoles ne sont pas harmonisés, les scores rapportés peuvent ne pas être comparables.
Principales fonctions de CMMLU
-
Banque de questions standardisées multidisciplinaire : Couvre 67 matières et est organisée en quatre catégories : sciences humaines (littérature chinoise, histoire, philosophie, etc.), sciences sociales (droit, économie, éducation, etc.), sciences et ingénierie (mathématiques, physique, informatique, etc.) et connaissances spécifiques au chinois (politique chinoise, géographie chinoise, folklore chinois, etc.). Il y a environ 170 questions dans chaque sujet, dans un format à quatre choix et une base aléatoire de 25 %. Valeur d'usage : Fournir une échelle de mesure standardisée pour la capacité de connaissance du chinois, rendant différents modèles comparables sur la même échelle.
-
Cadre d'évaluation flexible : prend en charge deux paramètres d'évaluation : zéro tir et quelques tirs (5 tirs par défaut). Le modèle d'invite, le nombre et l'ordre des exemples peuvent être ajustés pour s'adapter à la plage de performances optimale des différents modèles. Valeur d'utilisation : l'équipe peut choisir les paramètres d'évaluation les plus appropriés en fonction du type de modèle (réglage précis de la base ou de la commande) pour éviter les écarts causés par un seul style.
-
Résultats de base open source : L'entrepôt a divulgué les bases de précision de plusieurs modèles traditionnels dans diverses disciplines, notamment GPT-4, Claude, Qwen, Baichuan, InternLM, Yi et d'autres séries. Valeur d'usage : la nouvelle équipe modèle peut juger directement du niveau de capacités par rapport à la ligne de base sans établir de système de référence à partir de zéro.
-
Diagnostic des capacités au niveau du sujet : le script d'évaluation génère le taux de précision indépendant de chaque sujet et peut générer automatiquement un graphique radar ou un histogramme pour une comparaison horizontale. Valeur d'usage : localisez avec précision les matières dans lesquelles le modèle est fort (comme l'histoire chinoise, la littérature) et faible (comme les mathématiques avancées, la physique), et fournit une base quantitative pour l'appariement des données et l'ajustement de la stratégie de formation.
-
Évolutivité communautaire : l'ensemble de données et le code sont entièrement ouverts au public. L'équipe de recherche peut ajouter ou supprimer des sujets, modifier les questions, ajouter de nouvelles références de modèle ou extraire des interfaces des scripts d'évaluation et les intégrer dans des pipelines de tests personnalisés. Valeur d'usage : les équipes ciblant des secteurs spécifiques (tels que le droit, la médecine) peuvent créer des ensembles d'évaluation de terrain verticaux basés sur CMMLU et réutiliser la chaîne d'outils d'évaluation prête à l'emploi.
Avis d'expert : le « diagnostic au niveau du sujet » et la « comparaison de base » du CMMLU sont liés : la ligne de base fournit un cadre de référence et le score du sujet localise les lacunes. La combinaison des deux permet à l'équipe modèle de ne plus s'appuyer uniquement sur le score global pour mesurer la qualité du modèle, mais peut être précise quant à « quel sujet est le moins bon de X points de pourcentage ». Ce lien a une importance directrice directe pour l'optimisation du ratio de données de formation, la conception de stratégies d'apprentissage de cours et la sélection de données pour l'amélioration et le réglage du domaine.
Evolution du modèle et de la version de CMMLU
Version principale
-
Première version de l'article (2023-06) : Parallèlement à l'ensemble de données publiques de l'article arXiv v1.0 et à l'accord d'évaluation, 67 divisions de sujets et spécifications d'évaluation en 5 étapes sont établies. Le document rapporte également les résultats de base de GPT-4, ChatGPT et de plusieurs premiers modèles chinois. Il s'agit de l'étape initiale pour CMMLU et toutes les mises à jour ultérieures sont basées sur cette version.
-
Mise à jour de l'ensemble de données (~ 2024) : sur la base des commentaires de la communauté, les erreurs de questions et les problèmes d'étiquetage des réponses dans certains sujets ont été corrigés, et un petit nombre de nouvelles questions sur le sujet ont été ajoutées. Le numéro de version officiel n'est pas répertorié séparément et l'enregistrement de mise à jour est soumis au journal de validation GitHub. Modifications : Environ des dizaines d'erreurs ont été corrigées et le nombre total de sujets reste inchangé à 67.
-
Période de maintenance continue (2024 à aujourd'hui) : L'entrepôt utilise issue pour gérer les rapports de problèmes et les suggestions renvoyées par la communauté, et fusionne et corrige régulièrement les PR. Le tableau des scores de base est continuellement mis à jour à mesure que de nouveaux modèles sont publiés, mais les changements structurels apportés à l'ontologie de l'ensemble de données ont tendance à être stables. Points de changement : le nombre de modèles de base continue d'augmenter et la structure de base de l'ensemble de données n'a pas été modifiée de manière significative.
Points clés du contexte de la version
La fonctionnalité d'évolution de version de CMMLU est le modèle de référence académique de « publication unique d'un ensemble de données + mise à jour continue de la ligne de base », qui est différente de la gestion sémantique des versions des produits commerciaux. L'ensemble de données lui-même n'a été révisé qu'au niveau des errata depuis sa publication et n'a pas connu d'expansion structurelle ni de saut de numéro de version. Lors de la citation, la date de publication de l'article et le hachage de validation GitHub prévaudront.
| Version Jalon | Dates | Changements fondamentaux |
|---|---|---|
| Première version papier | ~2023-06 | Ensemble de données public 67 v1.0, script d'évaluation, scores de base |
| Mise à jour des erratas | ~2024 | Correction de quelques erreurs de questions, sujets complétés, pas de saut de numéro de version |
| Entretien continu | 2024 à aujourd'hui | Le modèle de base continue de s'étendre et la structure de l'ensemble de données reste stable |
Avantages techniques du CMMLU
Mécanisme : CMMLU adopte l'architecture d'évaluation hors ligne de « ensemble de données statiques + script d'évaluation local ». L'ensemble de données stocke la tige de la question, quatre options et l'index de réponse correcte de chaque question au format JSON ; le script d'évaluation lit séquentiellement les questions, construit des invites, appelle un raisonnement modèle, compare les réponses et compte l'exactitude par sujet.
Effet:
-
Entièrement reproductible hors ligne : Toute la logique d'évaluation est exécutée localement et ne repose sur aucun service externe. Toute équipe utilisant la même version de l’ensemble de données et du script peut obtenir des résultats cohérents. Cela élimine les interférences sur les scores causées par des facteurs incontrôlables tels que les différences de versions d'API, les mises à jour de services et l'échantillonnage aléatoire dans les avis en ligne.
-
Diagnostic de sujet à grain fin : La granularité de 67 sujets est à la pointe des critères d'évaluation chinois. En comparant les 57 matières de MMLU avec les 52 matières de C-Eval, la CMMLU a ajouté un grand nombre de subdivisions (telles que le système politique chinois, le folklore chinois, l'histoire chinoise ancienne, etc.) à la catégorie « connaissances spécifiques à la Chine », afin que la maîtrise des connaissances locales chinoises par le modèle puisse être mesurée individuellement.
-
Conception complémentaire avec MMLU : Le paramétrage du sujet de CMMLU et MMLU n'est pas simplement lié à la traduction chinois-anglais. Les disciplines couvertes par MMLU sont basées sur le système de connaissances occidental, tandis que CMMLU ajoute un grand nombre de dimensions de connaissances et d'évaluation propres à la Chine. En exécutant MMLU et CMMLU sur le même modèle en même temps, la différence entre les deux dimensions de « capacité de connaissances générales » et de « capacité de connaissances contextuelles chinoises » peut être séparée. Par exemple, un modèle qui fonctionne bien sur MMLU peut obtenir un score faible dans la catégorie de connaissances spécifiques à la Chine du CMMLU, ce qui suggère que le modèle n'a pas une couverture suffisante de la culture chinoise dans les données chinoises de pré-formation.
Scénarios applicables : CMMLU est plus approprié comme outil de diagnostic des capacités au cours de la phase de développement du modèle, plutôt que comme indicateur de publicité final avant la publication. L'exécution régulière d'une évaluation CMMLU pendant le processus de formation peut détecter rapidement la dégradation des capacités du modèle dans certains sujets (comme l'oubli de connaissances factuelles causé par un alignement excessif). Pour la publication de rapports, il est recommandé de combiner CMMLU avec C-Eval, MMLU, AGIEval, etc. pour former une suite d'évaluation afin d'éviter une surinterprétation des scores d'un seul benchmark.
Comment utiliser CMMLU
Contrôle d'entrée :
| Entrée | Objectif | Coût |
|---|---|---|
| Dépôt GitHub (haonan-li/CMMLU) | Téléchargement de l'ensemble de données, script d'évaluation, résultats de base, documentation | Gratuit |
| papier arXiv | Description de la méthode, définition du sujet, première ligne de base | Gratuit |
| Ensembles de données sur le visage câlin | Chargez directement CMMLU via la bibliothèque de jeux de données | Gratuit |
Étapes typiques :
- Récupérez l'ensemble de données :
git clone https://github.com/haonan-li/CMMLU.git, ou chargez-le directement viadatasets.load_dataset("haonan-li/cmmlu"). - Préparez le modèle : assurez-vous que le modèle à évaluer peut être chargé via AutoModelForCausalLM des transformateurs Hugging Face, ou implémentez une interface d'inférence compatible.
- Exécuter l'évaluation : exécutez le script d'évaluation, spécifiez le chemin du modèle, les paramètres d'évaluation (zéro-shot ou 5-shot), le répertoire de sortie et d'autres paramètres. Exemple de commande :
python eval.py --model Qwen/Qwen2-7B --shot 5 --output ./results. - Afficher les résultats : le script affiche le taux de précision de chaque sujet et le taux de précision moyen global, et génère également un tableau de comparaison visuel entre les sujets.
Conseils d'adaptation :
- Le format d'invite doit être unifié : différents modèles d'invite (par exemple, s'il faut ajouter une description de rôle, s'il faut utiliser des préfixes de commande chinois) peuvent entraîner une fluctuation du score de 2 à 5 points de pourcentage. La version de l'invite utilisée doit être notée lors de la communication des scores, sinon les résultats ne seront pas comparables.
- Caractère aléatoire des échantillons de quelques coups : dans une évaluation à 5 coups, l'ordre dans lequel les échantillons sont sélectionnés affectera les performances du modèle. Il est recommandé de fixer la valeur de départ aléatoire et d'en faire la moyenne sur plusieurs analyses afin de réduire la variance d'un seul échantillonnage.
- Contrôle des paramètres de décodage : l'évaluation doit utiliser un décodage gourmand (température = 0) pour éviter que le caractère aléatoire introduit par la stratégie d'échantillonnage n'interfère avec l'exactitude des statistiques.
- Compatibilité du tokenizer modèle : les tokenizers de certains modèles segmentent les caractères chinois de différentes manières, ce qui peut affecter la longueur réelle du token de l'invite et la compréhension du sujet par le modèle. Il est recommandé de vérifier que l'invite peut être correctement codée sur un petit échantillon avant une évaluation formelle.
Prix des produits pour CMMLU
- Modèle de facturation : Entièrement gratuit et open source. Pas de frais de licence, pas de frais d'abonnement, pas de paiement à l'utilisation.
- Frais inclus : La puissance de calcul nécessaire à l'évaluation est à la charge de l'utilisateur. Selon l'échelle du modèle, le coût de la puissance de calcul pour une seule évaluation à grande échelle se situe entre 1 et 30 $ (sur la base des tarifs à la demande des GPU cloud grand public).
- Privatisation d'entreprise : les ensembles de données peuvent être exécutés entièrement hors ligne, sans transfert de données sortant et sans frais SaaS supplémentaires.
- Aucun terme caché : La licence open source GitHub ne restreint pas l'utilisation commerciale, mais lors de la citation des scores CMMLU, la version des données et les paramètres d'évaluation doivent être indiqués pour que les résultats restent reproductibles.
Scénarios d'application de CMMLU
-
Diagnostic des capacités au cours de la phase de développement du modèle : exécutez régulièrement une évaluation CMMLU pendant le processus de pré-formation ou de réglage fin pour surveiller l'évolution des tendances des capacités du modèle dans différents sujets. Avantages réels : la dégradation des capacités dans certains sujets peut être détectée tôt (par exemple, le modèle oublie les connaissances historiques chinoises après un alignement excessif), et le ratio de données d'entraînement ou la stratégie d'entraînement peut être ajusté en temps opportun. Focus d'acceptation : définissez un seuil de précision au niveau du sujet (par exemple, chaque sujet ne doit pas être inférieur à 90 % du niveau de référence) comme condition d'accès pour savoir si le point de contrôle peut passer à l'étape suivante.
-
Déclaration de compétence lors de la sortie du modèle : signalez les scores CMMLU dans des rapports techniques ou des annonces de publication comme preuve quantitative de la maîtrise des connaissances en chinois. Avantages réels : offrez une échelle de capacités comparable au sein du secteur et réduisez l'asymétrie de l'information lorsque les utilisateurs effectuent des sélections. Problèmes d'acceptation : lors de la communication des scores, les paramètres d'évaluation (zéro-shot/5-shot, version rapide, paramètres de décodage) doivent également être notés, et les scores C-Eval et MMLU dans les mêmes conditions doivent être complétés pour une validation croisée.
-
Recherche universitaire et comparaison de référence : les chercheurs en PNL utilisent CMMLU comme outil d'évaluation pour la compréhension de la langue chinoise, rapportent les performances du modèle sur cette référence dans des articles ou mènent des recherches sur les méthodes d'évaluation (telles qu'une analyse de sensibilité rapide, une détection de pollution des données, etc.) basées sur CMMLU. Avantages réels : Fournir une plate-forme d'évaluation standardisée pour la recherche en PNL chinoise et réduire le coût d'évaluation des nouveaux modèles et des nouvelles méthodes.
-
Évaluation de la sélection du modèle de champ vertical : lors de la sélection de grands modèles dans les industries chinoises (droit, médecine, finance, etc.), les scores des disciplines correspondantes (telles que le droit, la médecine, l'économie) dans CMMLU sont utilisés comme l'une des dimensions de référence pour la sélection. Avantages réels : du point de vue de la couverture des connaissances, les modèles présentant des avantages évidents dans le domaine cible peuvent être rapidement sélectionnés et la portée des tests peut être réduite. Problèmes d'acceptation : seuls les scores des matières pertinentes doivent être mentionnés et la note moyenne globale ne doit pas être utilisée comme substitut à une évaluation spécifique au domaine.
Groupes applicables de CMMLU
-
Ingénieur et chercheur en algorithmes de grands modèles : une évaluation standardisée des connaissances chinoises est nécessaire pour vérifier l'effet de la formation du modèle, détecter la dégradation des capacités et comparer l'impact des différentes stratégies de formation. Le diagnostic au niveau de la matière fourni par CMMLU peut directement guider l'ajustement de l'allocation des données et la conception de l'apprentissage des cours. Prérequis : Posséder un raisonnement de modèle et des capacités de base d'exécution de scripts Python.
-
Chercheur universitaire NLP : Engagé dans des recherches sur la compréhension de la langue chinoise, la méthodologie d'évaluation, la détection de la pollution des données, etc., un ensemble de critères de référence publiquement reproductibles est nécessaire comme plate-forme expérimentale. La nature open source et la division fine des sujets du CMMLU offrent une flexibilité dans la conception expérimentale. Prérequis : Familiarisé avec l'écosystème Hugging Face et le processus d'évaluation standard.
-
Décisionnaire en matière de sélection de modèles et d'approvisionnement : lorsque les entreprises achètent de grands modèles ou sélectionnent des bases de modèles open source, utilisez le score CMMLU comme l'un des indicateurs de référence quantitatifs pour les capacités de connaissances chinoises. Pré-requis : Il est nécessaire de comprendre les limites du référentiel de questions à choix multiples et de ne pas l'utiliser comme seule base de prise de décision.
-
❌ Ne convient pas aux personnes :
- Utilisateurs finaux qui souhaitent accéder directement aux fonctionnalités disponibles telles que la conversation, la rédaction, la traduction, etc. - CMMLU est un outil de révision et non un produit d'application.
- Scénarios qui nécessitent d'évaluer la profondeur du raisonnement du modèle, la créativité et la qualité de plusieurs cycles de dialogue – dimensions que le format de questions à choix multiples ne peut pas mesurer.
- Les décideurs qui se réfèrent uniquement à un seul score global pour la sélection du modèle - le critère de référence des questions à choix multiples est affecté par la contamination des données, et le score global peut masquer de graves lacunes dans des sujets clés. Un jugement complet doit être effectué en conjonction avec d’autres évaluations et mesures réelles.
Résumé et Outlook
Compétences de base : CMMLU est devenu un élément indispensable du paysage chinois de l'évaluation des grands modèles avec sa division fine de 67 disciplines, sa couverture clé des connaissances spécifiques à la Chine et son architecture open source reproductible entièrement hors ligne. Il complète C-Eval - le premier se concentre sur le gradient de difficulté des matières générales, et le second se concentre sur la profondeur des connaissances locales chinoises - et la combinaison des deux peut caractériser plus complètement la structure des capacités de connaissances chinoises du modèle.
Limites actuelles :
- Risque de pollution des données : les ensembles de données publiques statiques sont facilement « vus à l'avance » par le modèle pendant la phase de pré-formation, ce qui entraîne des scores faussement élevés. Actuellement, CMMLU ne dispose pas de génération dynamique de questions ni de mécanisme d'actualisation régulier, et le recours à long terme à des versions corrigées sera confronté à de plus en plus de problèmes de pollution.
- Type de question unique : il n'y a que quatre questions à choix multiples, qui ne peuvent pas évaluer les capacités de raisonnement génératif, de raisonnement en plusieurs étapes, de questions ouvertes et de réponses du modèle. Les scores élevés reflètent uniquement la quantité de connaissances factuelles mémorisées et ne garantissent pas les performances dans les applications pratiques.
- Il existe encore des lacunes dans la couverture des sujets : bien que les 67 sujets soient déjà à haute densité, la couverture des sujets interdisciplinaires émergents (tels que l'éthique de l'IA, les sciences sociales computationnelles) et de certaines industries verticales (telles que les produits pharmaceutiques, l'ingénierie financière) est insuffisante.
- Standardisation insuffisante des protocoles d'évaluation : Les différences dans les paramètres de quelques plans du modèle d'invite et dans l'extraction des réponses entre les différentes équipes entraînent toujours des scores qui ne sont pas directement comparables. La communauté a besoin d’un protocole d’évaluation standard plus strict.
Points d'observation de suivi :
- Si la CMMLU lancera une version d'évaluation dynamique de "Privacy Set" pour lutter contre la pollution des données.
- Peut-il être lié et transformé avec des évaluations de tâches réelles (telles que Baichuan-TextEval, SuperCLUE) pour aider les utilisateurs à comprendre la signification réelle des résultats des tests à choix multiples dans des scénarios d'application.
- Si la communauté construira des ensembles d'extensions industrielles verticales (tels que CMMLU-Med, CMMLU-Law) basés sur le cadre CMMLU.
- Une fois que les scores des modèles traditionnels convergent vers CMMLU, la question de savoir si le benchmark doit augmenter la difficulté ou introduire des échantillons contradictoires pour maintenir la discrimination.
Évaluation des risques d'approvisionnement et d'adoption : Pour les équipes qui envisagent d'intégrer CMMLU dans le système d'évaluation, il est recommandé de suivre les étapes suivantes : à court terme (1 à 2 semaines), l'intégrer dans le pipeline d'évaluation existant, l'exécuter simultanément avec MMLU et C-Eval et établir une comparaison de référence ; à mi-parcours (1 à 3 mois), se concentrer sur les résultats de diagnostic au niveau du sujet du CMMLU pour guider l'ajustement du rapport de données avant la formation ; à long terme (plus de 6 mois) suivre de près les tendances de contamination des données du CMMLU, telles que l'inflation des scores observée par la communauté dépassant une fourchette raisonnable, devrait être envisagée pour compléter d'autres indicateurs d'évaluation hétérogènes. Pour la déclaration de capacité d'un modèle commercial, il est recommandé de toujours divulguer les scores MMLU et C-Eval dans les mêmes conditions en plus du CMMLU, et d'indiquer clairement les paramètres d'évaluation (numéro de prise de vue, version d'invite, paramètres de décodage) pour éviter une sélection de modèle trompeuse en raison d'évaluations incohérentes.
Outils associés : hugging-face, replicate
Informations de version
- Benchmark d'évaluation CMMLU (GitHub open source) :Le référentiel open source complet d'évaluation des connaissances chinoises couvre des questions à choix multiples dans les domaines des sciences humaines, des sciences sociales, des sciences et de l'ingénierie, ainsi que des connaissances spécifiques au chinois. Il fournit des ensembles de données, des scripts d'évaluation et des scores de base. La version officielle est basée sur l'entrepôt et le papier. Les numéros de versions mineures consécutives ne sont pas répertoriés séparément. Les dates sont approximatives.
- Publication du document et de l'ensemble de données du CMMLU pour la première fois :L'ensemble de données et le protocole d'évaluation seront divulgués avec le document, et la division par sujet et la méthode d'évaluation de base seront établies. Le suivi portera principalement sur les mises à jour de l'entrepôt et les suppléments de résultats. Le responsable n'a pas divulgué la date précise, et la date est une approximation.
Avis des utilisateurs