Évaluation C
Gratuit
C-Eval est une suite d'évaluation complète en chinois pour les grands modèles linguistiques. Il contient 13 948 questions à choix multiples, couvrant 52 sujets et quatre niveaux de difficulté. Il fournit également des classements publics et constitue l’un des critères académiques couramment utilisés pour mesurer la capacité des modèles chinois de base.
C-Eval
Paramètres de base et statistiques de C-Eval
C-Eval n'est pas une application destinée aux utilisateurs finaux, mais un ensemble de critères d'évaluation de grands modèles chinois destinés aux chercheurs et aux équipes de modèles. Sa valeur fondamentale est « d'utiliser une banque de questions unifiée et comparable pour mesurer les connaissances chinoises et la capacité de raisonnement du modèle ». Le problème qu’il résout est le manque d’échelles d’évaluation horizontales standardisées et interdisciplinaires dans le scénario chinois.
| Projets | Informations publiques |
|---|---|
| Type de référence | Kit d'évaluation multidisciplinaire chinois grand modèle |
| Taille des questions | 13948 questions à choix multiples |
| Couverture du sujet | 52 sujets |
| Niveaux de difficulté | Quatre niveaux de difficulté (de base, professionnel, postuniversitaire, complet) |
| Source des questions | Examen universitaire chinois, examen d'entrée aux études supérieures, examen de qualification professionnelle, concours ouvert |
| Formater | Banque de questions publiques + classement en ligne |
| Ouverture | Ensemble de données et code GitHub open source (licence MIT) |
| Modèle de facturation | Gratuit (repère académique) |
| Protocole d'évaluation | Paramètres 5 prises et 0 prises |
| Échelle de classement | Inclut en permanence les résultats de dizaines de modèles grand public |
Signification du paramètre : 13948 questions couvrant tout le spectre depuis les matières de base (mathématiques, physique, chimie) jusqu'aux domaines professionnels (médecine, droit, informatique) jusqu'au raisonnement avancé (logique, éthique). La conception hiérarchisée de 52 matières permet au modèle non seulement de produire un score global, mais également de ventiler les profils de compétences par matière. Les quatre niveaux de difficulté (de base, professionnel, supérieur et complet) distinguent davantage l'écart entre les modèles de simple bon sens et de raisonnement d'ordre élevé - le même modèle peut être proche de la note maximale au niveau de base, mais chuter considérablement au niveau des cycles supérieurs. Cet écart peut mieux refléter la véritable profondeur des capacités du modèle que le score total.
Protocole d'évaluation : C-Eval fournit par défaut deux paramètres d'évaluation : 5 tirs (5 exemples) et 0 tir (aucun exemple). Les résultats à 5 coups reflètent généralement les performances du modèle dans le cadre d'un petit apprentissage contextuel (apprentissage en contexte), tandis que les résultats à 0 coup sont plus proches de la maîtrise des « connaissances nues » du modèle. La différence entre les deux peut aider à déterminer dans quelle mesure le modèle dépend du format d’échantillon.
Comparaison des références : comparé à des références d'évaluation chinoises similaires, C-Eval présente des différences évidentes dans l'étendue des sujets et la stratification des difficultés.
| Référence | Nombre de questions | Sujet/domaine | Niveau de difficulté | Forme organisationnelle | Langue |
|---|---|---|---|---|---|
| C-Eval | 13948 | 52 sujets | Quatre niveaux (de base/professionnel/diplôme/complet) | Choix multiples | Chinois |
| MMLU | ~15900 | 57 matières | Pas de stratification claire | Choix multiples | Anglais |
| CMMLU | ~10 000 | 67 sujets | Pas de stratification claire | Choix multiples | Chinois |
| AGIEval | ~6800 | Plus de 20 types d'examens | Score par source d'examen | Choix multiples + remplir le vide | Chinois-anglais |
| GAOKAO | ~4500 | 9 questions d'examen d'entrée à l'université | divisé par niveau | choix multiples + remplir les espaces | Chinois |
Vérification de la publicité : le site officiel le positionne clairement comme « une suite d'évaluation chinoise multi-niveaux et multidisciplinaire adaptée aux grands modèles linguistiques (2023) ». Les paramètres clés tels que 13948 questions et 52 disciplines, quatre niveaux de difficulté et les protocoles open source peuvent être directement vérifiés sur le site officiel et le référentiel GitHub.
Reconnaissance des utilisateurs et du marché de C-Eval
- Recherche et adoption par l'industrie : C-Eval est devenu de facto le « test d'entrée » pour les grands modèles chinois. Presque tous les grands modèles nationaux (y compris DeepSeek, Tongyi Qianwen, Wenxinyiyan ChatGLM, Baichuan, Yi series, etc.) indiqueront les scores C-Eval lors de la publication de rapports techniques ou de publicités comme indicateur de référence clé de la capacité chinoise. Selon les statistiques des rapports techniques publics, il existe plus de 15 modèles avec un score total de plus de 90 % dans les cinq taux d'exactitude de classification de C-Eval (à la mi-2026), ce qui reflète l'attention continue de cette référence dans les itérations du modèle.
- Données vérifiables : 13 948 questions, 52 sujets et quatre niveaux de difficulté sont tous accessibles au public sur le site officiel. Les classements sont continuellement mis à jour sur le site officiel, et les scores soumis par chaque modèle sont accompagnés de l'heure de soumission et des instructions de réglage (telles que 5-shot / 0-shot).
- Citations académiques : l'article original de C-Eval a été cité plus de 2 000 fois sur Google Scholar (à la mi-2026), devenant ainsi l'un des articles de référence les plus cités dans le domaine de l'évaluation de la PNL chinoise.
- Community Ecology : le référentiel GitHub (hkust-nlp/ceval) affiche publiquement plus de 400 étoiles, plus de 100 forks et des discussions actives sur les problèmes et les relations publiques, reflétant l'inquiétude de la communauté universitaire pour cette norme et sa volonté de s'améliorer continuellement.
- Description des limites : les scores de classement sont soumis par chaque équipe modèle ou obtenus par évaluation par un tiers. Il existe des différences dans les paramètres d'évaluation (modifications dans la formulation de l'invite, taille du lot, stratégie de décodage de sortie, etc.). En tant que référence de questions à choix unique, C-Eval ne couvre pas des dimensions telles que la qualité de la génération, le suivi des instructions et les multiples cycles de dialogue, et ne peut pas représenter pleinement les performances globales du modèle dans des tâches réelles. De plus, comme la banque de questions est une banque de questions publique statique, il existe un risque d'être « mémorisée » par les données de pré-entraînement (pollution des données), c'est-à-dire que le modèle peut avoir vu certaines questions pendant la phase d'entraînement, obtenant ainsi des scores faussement élevés.
Avantages financiers de C-Eval
C-Eval lui-même ne facture aucun frais d'utilisation, mais le coût complet de l'évaluation doit être décomposé en trois niveaux : « chercheur individuel », « équipe universitaire/modèle » et « évaluation de l'industrialisation de l'entreprise ».
C-side/Chercheur personnel
- Coût de l'outil : coût nul. L'ensemble de données et le code d'évaluation sont entièrement open source et peuvent être téléchargés directement depuis GitHub et utilisés.
- Coût de la puissance de calcul : apportez votre propre GPU. Une seule évaluation complète de 13 948 questions prend environ 1 à 4 heures sur une seule carte A100-80G (en fonction de la taille du modèle et de l'efficacité du décodage). Pour les petits modèles avec moins de 7B de paramètres, un seul GPU grand public (tel que le RTX 4090) peut compléter l'évaluation.
- Coût caché : Vous devez configurer correctement le contexte d'évaluation (dépendances Python, PyTorch et transformateurs) et comprendre le protocole d'évaluation (format de modèle 5-shot, règles d'extraction de réponses). Les débutants peuvent passer 1 à 3 jours sur cette section.
Développeurs d'API et équipe de modèles
- Coût de l'outil : coût nul.
- Coût d'intégration : l'intégration du script d'évaluation C-Eval dans le pipeline de formation du modèle (par exemple, l'exécution automatique après l'enregistrement de chaque point de contrôle) nécessite un investissement en ingénierie. Le script d'évaluation officiel de Python est fourni, mais les exigences avancées telles que la comparaison des versions du modèle par lots, la visualisation des résultats et la détection des anomalies doivent être développées par vous-même.
- Coût de comparaison : si vous devez effectuer une comparaison équitable avec des modèles concurrents avec les mêmes paramètres, vous devez préparer votre propre contexte d'inférence ou accès API pour les modèles concurrents. Cette partie du coût incombe au modèle appelant, et non à C-Eval lui-même.
Besoins d'évaluation en entreprise et à grande échelle
- Coût de l'outil : coût nul. Il n'y a pas de frais de licence commerciale et la licence open source du MIT permet une utilisation commerciale et une redistribution.
- Coût d'évaluation à grande échelle : si une entreprise doit effectuer plusieurs évaluations sur des dizaines de variantes de modèle (telles que des expériences contrôlées avec différentes stratégies de réglage fin), le coût de la machine augmentera linéairement. Le script officiel prend en charge l'évaluation parallèle, mais les solutions à grande échelle nécessitent que l'équipe construise elle-même un cadre d'évaluation distribué.
- Coût de conformité : Aucun. La banque de questions C-Eval provient de documents académiques publics et de questions d'examen, et la licence de l'ensemble de données est MIT, sans risques de non-conformité supplémentaires. Toutefois, si une entreprise utilise son propre ensemble d’évaluations ou des questions élargies, elle doit confirmer elle-même ses droits.
Dimensions de comparaison : par rapport aux ensembles d'évaluation auto-construits, C-Eval fournit une banque de questions standardisées prêtes à l'emploi et une liste unifiée, économisant ainsi les coûts de construction (nécessitant généralement 2 à 5 mois-homme) et d'alignement. Par rapport à l'utilisation du MMLU anglais pour l'évaluation, C-Eval est orienté vers des scénarios chinois, couvre le système de matières chinois et peut refléter plus précisément le véritable niveau du modèle dans la connaissance et le raisonnement chinois.
Principales fonctions de C-Eval
- Banque de questions standardisées : 13948 questions à choix multiples couvrant 52 sujets, chaque question comporte 4 options, un format unifié et prend en charge la notation automatique. Les matières sont divisées en quatre catégories : sciences humaines et sociales (telles que l'histoire, la philosophie, l'économie), STEM (telles que les mathématiques, la physique, l'informatique), médecine (telles que la médecine clinique, la pharmacie, la médecine fondamentale) et autres (telles que la logique, l'éthique, le droit), couvrant le système de connaissances de base de l'enseignement supérieur et des examens de qualification professionnelle en Chine.
- Stratifications de difficultés multiples : Quatre niveaux de difficulté - Basique (correspondant aux connaissances de base du premier cycle), Professionnel (correspondant à des connaissances approfondies dans des domaines professionnels), Postuniversitaire (correspondant à des concepts avancés au niveau des cycles supérieurs), Complet (application globale interdisciplinaire). Cette stratification peut non seulement mesurer « l'étendue » du modèle, mais également distinguer la « profondeur » : un modèle qui obtient un score de 90 % au niveau de base et seulement 50 % au niveau des cycles supérieurs, et un modèle qui obtient un score de 80 % aux deux niveaux, peuvent correspondre à des voies de recherche et de développement complètement différentes (le premier doit améliorer le raisonnement d'ordre élevé, et le second doit réparer les angles morts des connaissances).
- Classement public : Le site officiel collecte en permanence les scores à 5 coups et à 0 coup de chaque modèle et les trie en fonction du score moyen global. La liste de classement comprend la répartition par sujet, la date de soumission et les paramètres d'évaluation pour chaque note, ce qui facilite la référence horizontale. Il n'y a aucune restriction sur le processus de soumission pour les classements, mais les soumissionnaires sont tenus d'indiquer la configuration d'évaluation pour maintenir une comparabilité de base.
- Code et données open source : le référentiel GitHub fournit un ensemble de données complet (format JSON), un script d'évaluation (Python, basé sur le framework lm_eval), un modèle d'invite et une logique d'extraction de réponses. Prend en charge l'accès au modèle personnalisé, implémentez simplement l'interface de génération de texte standard (entrée → sortie → notation). La communauté dispose déjà de nombreux articles d'interprétation et de versions améliorées par des tiers (telles que l'expansion multilingue, l'ajustement adaptatif de la difficulté de l'évaluation, etc.).
- Rapport de diagnostic au niveau du sujet : la granularité de classification des sujets de C-Eval prend en charge la capacité de générer des modèles
"carte radar". Par exemple, un modèle peut obtenir des résultats élevés en informatique et en mathématiques, mais un score significativement faible en sciences médico-légales ou en éthique. Ce diagnostic granulaire peut mieux guider la supplémentation ciblée des données d’entraînement qu’un seul score total.
Evolution du modèle et des versions de C-Eval
En tant que référence académique, « l'itération de version » de C-Eval se reflète principalement à trois niveaux : la maintenance des ensembles de données, la mise à jour du classement et l'optimisation du protocole d'évaluation, plutôt que l'augmentation du numéro de version du logiciel au sens traditionnel du terme.
1. Version initiale (2023-05)
- Publié pour la première fois avec l'article "C-Eval: A Multi-Level Multi-Discipline Chinese Evaluation Suite for Large Language Models".
- Établir une structure de base de 13948 questions dans 52 matières et quatre niveaux de difficulté.
- Le classement initial est rendu public, comprenant les résultats du premier lot de modèles tels que GPT-4, ChatGPT et Claude.
- Lorsque l'article a été publié, le score total du GPT-4 sous le paramètre 5-shot était d'environ 68 %, tandis que le score le plus élevé du modèle open source chinois à cette époque était d'environ 45 % à 50 %, reflétant l'écart important dans les connaissances chinoises entre les modèles chinois et étrangers.
2. Amélioration de l'ensemble de données et mise au point du protocole (2023-06 à 2024-06)
- Grâce aux commentaires de la communauté, nous corrigerons progressivement les réponses incorrectes à certaines questions et les écarts dans la classification des sujets (le problème GitHub peut être retracé).
- Le 5-shot est clairement recommandé comme protocole d'évaluation par défaut et le modèle d'invite est standardisé pour améliorer la comparabilité des résultats.
- Ajout de tests de compatibilité pour différentes séries de modèles (architecture MoE, modèles de réglage fin de l'apprentissage par renforcement, etc.).
- Le nombre de modèles inclus dans le classement a été augmenté de la douzaine initiale à des dizaines, couvrant les modèles open source et fermés grand public.
3. Expansion continue de l'influence (2024-06 à aujourd'hui)
- Le score C-Eval est devenu l'indicateur « standard » pour les rapports techniques chinois sur grands modèles.
- Les travaux dérivés ultérieurs (tels que C-Eval Hard, C-Eval Zero) tentent d'augmenter la difficulté de l'évaluation d'échantillons contradictoires ou d'échantillons nuls basés sur C-Eval.
- L'article original est devenu un article de référence très cité dans le domaine de l'évaluation de la PNL chinoise.
- Relever le défi de la contamination des données : à mesure que l'ensemble de données d'origine est largement divulgué, les modèles de formation ultérieurs peuvent être passivement exposés à des questions via des fuites de données de formation, ce qui entraîne des scores faussement élevés. La communauté envisage déjà de créer une banque de questions dynamique avec des questions invisibles comme alternative.
Avantages techniques de C-Eval
- Conception bidimensionnelle du sujet et de la difficulté : L'innovation fondamentale de C-Eval est d'organiser des questions à partir de deux dimensions orthogonales du « domaine » et du « niveau de difficulté » en même temps. Cela fait que le résultat de l'évaluation n'est pas seulement un score total, mais une matrice de capacités 52 × 4, chaque grille représentant la performance du modèle sur un niveau de difficulté spécifique dans un sujet spécifique. Dans le contexte du « large calibre et des bases épaisses » de l'enseignement supérieur chinois, cette granularité est mieux à même de saisir les lacunes de la structure des connaissances du modèle que la classification par matière unique de MMLU.
- Protocole d'évaluation reproductible chinois : C-Eval stipule clairement le format de l'invite, les règles d'extraction des réponses et les normes de notation pour les tirs à 5 et à 0. Comparé à certains benchmarks qui fournissent uniquement des ensembles de données mais ne s'accordent pas strictement sur les protocoles d'évaluation, le degré élevé de normalisation de C-Eval garantit que les résultats des différentes équipes et à différents moments sont fondamentalement comparables horizontalement. C’est la principale raison technique de son adoption généralisée.
- Conception de questions basées sur les examens : les questions proviennent de véritables examens chinois (finales universitaires, examens d'entrée de troisième cycle, examens de qualification professionnelle), et non auto-compilées par les chercheurs. Cela signifie que les questions ont naturellement : (1) le langage est réel et naturel, sans le sentiment artificiel du « langage des ensembles de données » ; (2) Les réponses ont des normes claires faisant autorité et il n'y a aucune ambiguïté subjective ; (3) Ils sont alignés sur le système de connaissances éducatives chinois et peuvent refléter directement le niveau de connaissances du modèle dans le contexte chinois. Cela entraîne également des limites : l'actualité des questions est limitée par la durée de l'examen et la couverture des domaines émergents (tels que l'éthique de l'IA, l'informatique quantique et d'autres sujets qui n'ont pas encore fait l'objet d'examens standardisés) est faible.
- Évaluation - Diagnostic - Fermé : La valeur technique de C-Eval n'est pas seulement "hors score", mais réside dans ses capacités de diagnostic à la granularité du sujet. Après avoir reçu les résultats du C-Eval, une équipe modèle peut immédiatement localiser les sujets faibles, puis compléter les données de pré-entraînement ou affiner les données sur ce sujet de manière ciblée. Ce processus de l'évaluation à l'amélioration jusqu'au prochain cycle d'évaluation,
Faites de C-Eval un tableau de bord pour l'itération des capacités du modèle plutôt qu'une ligne d'arrivée.
Comment utiliser C-Eval
Comparaison d'entrée
| Objectif | Entrée | Descriptif |
|---|---|---|
| Voir la description et les classements | https://cevalbenchmark.com/ | Site officiel, positionnement de navigation, classements, classifications par sujet |
| Télécharger l'ensemble de données et le code | https://github.com/hkust-nlp/ceval | Dépôt GitHub, ensemble de données complet et script d'évaluation |
| Lire le journal | https://arxiv.org/abs/2305.10957 | arXiv, comprendre les principes de conception et les résultats de base |
| Discussion communautaire | Problèmes GitHub, Zhihu | Problèmes de feedback, paramètres de discussion et d'évaluation |
Étapes d'évaluation standard
- Préparation des limites : clonez le référentiel et installez les dépendances Python (PyTorch, transformateurs, ensembles de données, etc.).
- Chargement des données : utilisez le répertoire de données
ceval/fourni par l'entrepôt, ou chargezceval/cevalvia les ensembles de données Hugging Face. - Configurer l'évaluation : définissez les paramètres d'évaluation : nom ou chemin du modèle, paramètres d'évaluation (5 tirs ou 0 tirs), durée de génération maximale, etc.
- Exécuter l'évaluation : exécutez le script d'évaluation, et le script chargera automatiquement le modèle → effectuera le raisonnement et la réponse → extraira la réponse → comparera avec la réponse standard → calculera l'exactitude de chaque sujet et l'exactitude globale.
- Analyse des résultats : vérifiez les résultats (taux de précision de chaque sujet et moyenne globale) et comparez-les avec les classements pour localiser l'écart.
Notes clés
- Cohérence de l'invite : de petites modifications dans le modèle d'invite (telles que « La réponse est » par rapport à « Réponse : ») peuvent entraîner une fluctuation des scores de 1 à 3 points de pourcentage. Assurez-vous que l'invite utilisée est cohérente avec le modèle officiel par défaut, sinon les résultats ne seront pas comparables.
- Stratégie de décodage : Il est recommandé d'utiliser un décodage gourmand (
temperature=0) ou des paramètres cohérents. Des stratégies telles que la recherche de faisceaux et l'échantillonnage entraîneront une sortie instable et affecteront la reproductibilité. - Pondération du sujet : La note moyenne globale dans le classement adopte la moyenne pondérée du sujet (plutôt qu'une simple moyenne arithmétique). Le poids spécifique varie en fonction du nombre de questions thématiques. Lorsque vous comparez les classements, vous devez confirmer que les méthodes de pondération sont cohérentes.
Prix des produits pour C-Eval
| Niveau utilisateur | Élément de coût | Descriptif |
|---|---|---|
| Chercheurs C-side/individuels | Gratuit | L'ensemble de données et le code sont entièrement open source, licence MIT, aucun frais de licence |
| Équipe académique/modèle | Gratuit | Pas de frais d'abonnement ni de paiement à la séance, critiques illimitées |
| Entreprise | Gratuit (couche d'outils) | Coût nul pour la couche d'outils ; une évaluation à grande échelle nécessite un cluster informatique auto-préparé |
| Utilisation commerciale | Gratuit | La licence MIT autorise l'utilisation commerciale et la redistribution sans autorisation supplémentaire |
Coûts inclus : Le coût principal de l'évaluation n'est pas l'outil lui-même, mais la puissance de calcul d'inférence du modèle et l'intégration technique. La consommation d'énergie de calcul d'une évaluation C-Eval complète (13 948 questions, 5 étapes) dépend de la taille du modèle : un modèle 7B nécessite environ 0,5 à 1 heure GPU (A100), un modèle 70B nécessite environ 4 à 8 heures GPU et un modèle 700B+ peut nécessiter plus de 24 heures. Si une évaluation fréquente est nécessaire (par exemple après chaque point de contrôle de formation), le coût total de la puissance de calcul s'accumulera rapidement.
Scénarios d'application de C-Eval
- Autotest de développement de modèle : lors de la formation ou de la mise au point d'un grand modèle chinois, effectuez une évaluation C-Eval après chaque point de contrôle clé pour vérifier si la direction itérative des connaissances et des capacités de raisonnement est correcte. Points d'acceptation : comparez les changements au niveau du sujet entre les deux évaluations avant et après - si le score total augmente mais qu'un certain sujet diminue de manière significative, cela peut signifier un oubli catastrophique et le rapport des données d'entraînement doit être vérifié.
- Divulgation des capacités externes : lorsque le modèle est publié ou mis à niveau, les résultats C-Eval seront répertoriés dans le rapport technique ou sur la page publique en tant que référence tierce pour la maîtrise du chinois. Points clés pour l'acceptation : Marquez clairement les paramètres d'évaluation (5 tirs/0 tirs, version rapide, méthode de notation) pour garantir l'alignement avec le classement ; si des paramètres non standard sont utilisés, les scores des paramètres standard doivent également être donnés à des fins de comparaison horizontale.
- Diagnostic du sujet et conseils de formation : localisez les lacunes des capacités du modèle grâce aux résultats de granularité du sujet de C-Eval pour guider les stratégies ultérieures de collecte de données et de formation. Par exemple, si le modèle continue de donner de mauvais résultats dans les disciplines « Droit » et « Médecine », vous pouvez envisager d'ajouter un corpus chinois des disciplines correspondantes dans la phase de pré-formation, ou de compléter les paires questions-réponses des disciplines dans la phase SFT. Clé d'acceptation : La conclusion du diagnostic doit être validée de manière croisée avec la distribution des données de formation : un score faible dans un certain sujet peut être dû à une formation insuffisante des connaissances sur le sujet, ou il peut s'agir d'un problème de généralisation causé par l'incohérence entre la méthode d'expression des questions C-Eval et la distribution des données de formation.
- Recherche universitaire et construction de références : comme base de référence pour l'évaluation de la PNL chinoise, utilisée pour comparer les méthodes d'évaluation ou les ensembles de données nouvellement proposés, ou comme plate-forme standardisée pour la comparaison des capacités entre modèles. Point d'acceptation : les méthodes d'évaluation nouvellement proposées doivent être vérifiées sur C-Eval pour vérifier leur corrélation avec les capacités réelles du modèle.
Groupes applicables de C-Eval
- Chercheurs de grands modèles et ingénieurs en algorithmes : une évaluation chinoise standardisée est nécessaire pour quantifier les effets d'itération du modèle et guider les stratégies de formation grâce à un diagnostic granulaire du sujet. Prérequis : Avoir un raisonnement de modèle de base et des capacités de construction contextuelle, et comprendre le projet Prompt et le protocole d'évaluation.
- Ingénieur d'évaluation de modèles : responsable de la création d'un pipeline d'évaluation automatisé pour l'équipe, de l'intégration de C-Eval dans le processus CI/CD et du suivi continu des changements de capacité des versions de modèle. Prérequis : Familier avec Python et les frameworks d'inférence de grands modèles traditionnels (Hugging Face Transformers, vLLM, etc.), et capable de gérer des scénarios d'évaluation distribués.
- Chercheurs universitaires : engagés dans l'évaluation de la PNL chinoise, la recherche de référence et l'analyse inter-modèles, en utilisant C-Eval comme référence pour comparer de nouvelles méthodes ou de nouveaux ensembles de données. Prérequis : Comprendre la méthodologie d'évaluation et prêter attention à l'impact des problèmes de contamination des données sur les résultats expérimentaux.
- Évaluateur de sélection technique (CTO/VP technique) : Incorporez les scores C-Eval dans la matrice d'évaluation en tant que dimension quantitative de la maîtrise du chinois avant d'acheter ou d'introduire des modèles de base. Prérequis : Reconnaître les limites d'un benchmark unique et porter des jugements complets basés sur des évaluations basées sur des scénarios (telles que des tests fonctionnels de produits, une vérification des niveaux de gris à petite échelle).
- Limite inadéquate : (1) Utilisateurs ordinaires qui ont besoin d'obtenir directement les « fonctionnalités disponibles du produit » - C-Eval est une référence d'évaluation plutôt qu'une application interactive et ne peut pas être utilisé directement ; (2) Équipes qui doivent évaluer les performances du modèle sur des tâches ouvertes telles que la qualité du dialogue, la sécurité et la génération d'idées - C-Eval Le format de questions à choix multiples ne peut pas couvrir la mesure de la capacité générative ; (3) Les équipes s'inquiètent de la contamination des données : la banque de questions statique peut être couverte par des données de pré-formation, il est recommandé de combiner d'autres banques de questions invisibles (telles que des ensembles d'évaluation internes auto-construits) pour une validation croisée ; (4) Équipes qui doivent évaluer des modèles dans des scénarios non chinois - C-Eval est entièrement orienté vers les systèmes de sujets chinois et chinois, et l'évaluation des modèles anglais doit être optimisée
Commencez par utiliser MMLU ou un benchmark anglais équivalent.
Résumé et Outlook
Avec 13 948 questions dans 52 matières et quatre niveaux de difficulté, C-Eval constitue l'un des critères d'évaluation de modèles chinois à grande échelle les plus systématiques. Sa principale compétitivité réside dans la conception raffinée de la double dimension du sujet et de la difficulté, le protocole d'évaluation reproductible et les classements continuellement mis à jour - ces trois éléments élèvent C-Eval d'un ensemble de données à un écosystème d'évaluation standardisé. Pour l'équipe du modèle de base chinois, C-Eval est à la fois un « test d'entrée » et un « outil de diagnostic » : le score total mesure le niveau de compétence, et les scores au niveau de la matière révèlent l'orientation des lacunes.
Limites actuelles : (1) La banque de questions statique est confrontée au risque de contamination des données. Comme la banque de questions est largement divulguée, le modèle post-formation peut obtenir passivement des questions via une fuite de données de formation, ce qui entraîne des scores faussement élevés et réduit la crédibilité du benchmark ; (2) Le format des questions à choix multiples ne peut pas couvrir les besoins d'évaluation des tâches génératives (telles que la qualité de la traduction, l'exactitude des fonctions du code, l'écriture créative) ; (3) La couverture des sujets est biaisée en faveur des systèmes de connaissances traditionnels, ce qui n'est pas bon pour l'IA. Les sujets d'avenir tels que l'éthique, l'informatique quantique et les domaines émergents de l'ingénierie ne sont pas suffisamment couverts ; (4) La soumission et l'examen des classements reposent sur un mécanisme autonome, et la comparabilité des scores entre les différents modèles est affectée par les différences dans les paramètres d'évaluation.
Orientations futures : la communauté explore déjà la version dynamique de la banque de questions de C-Eval (telle que le pool de questions non public, la définition adaptative des questions) pour atténuer le problème de la pollution des données ; dans le même temps, la version multimodale et l'expansion bilingue chinois-anglais sont également des directions d'extension naturelles. La maintenance continue de la communauté et les mises à jour des sujets sont essentielles pour que C-Eval conserve son statut de référence.
Évaluation des risques d'approvisionnement/d'adoption : pour les équipes qui évaluent des modèles de base ou des grands modèles auto-développés, C-Eval est un outil d'évaluation d'entrée de gamme à faible coût et à rapport signal/bruit élevé - aucun frais de licence, open source et reproductible, et des fonctions de diagnostic granulaires par sujet peuvent guider directement la formation. Mais il ne faut pas l’utiliser comme seul critère d’évaluation. Il est recommandé d'utiliser une combinaison d'évaluation multidimensionnelle de « C-Eval + plusieurs évaluations internes basées sur des scénarios + évaluation manuelle à petite échelle » lors de la sélection du modèle ou des itérations de R&D afin de réduire le risque de sélection causé par un seul écart de référence. Lorsque les équipes utilisent les scores C-Eval pour une comparaison horizontale, elles doivent confirmer que tous les scores sont obtenus selon les mêmes paramètres d'évaluation (5-shot/0-shot, le même modèle d'invite) pour éviter des conclusions trompeuses dues aux différences de paramètres.
Outils associés : hugging-face, replicate
Informations de version
- Kit d'évaluation C-Eval (2023) :Le grand kit d'évaluation multidisciplinaire chinois, rendu public, contient 13 948 questions à choix multiples dans 52 matières et quatre niveaux de difficulté, et fournit des classements en ligne pour enregistrer en continu les résultats du modèle. La page officielle porte l'année 2023, et la date exacte dépend du papier et de l'entrepôt.
- L'article et l'ensemble de données C-Eval sont publiés pour la première fois :C-Eval sera publié pour la première fois avec des articles et des ensembles de données, une banque de questions, une division par sujet et un protocole d'évaluation seront établis, et les classements seront lancés en ligne. Il n'existe pas de liste officielle des numéros de versions mineures ultérieures, et l'itération se reflète principalement dans la mise à jour continue des classements.
Avis des utilisateurs