OpenAI triple le score ARC-AGI-3 avec « deux paramètres » : le benchmark rencontre une crise de confiance

OpenAI a publié un rapport de recherche le 29 juillet, révélant que « deux paramètres » peuvent tripler le score du modèle sur le benchmark ARC-AGI-3, révélant que les résultats de l'évaluation sont fortement liés aux paramètres d'inférence/décodage, et rappelant à l'industrie de se méfier des résultats faussement élevés causés par une « dépendance à la configuration de l'évaluation ».

Le 29 juillet, OpenAI a publié un rapport de recherche qui semblait « exposer ses propres lacunes » : il révélait que grâce à « deux paramètres », le score du modèle sur le benchmark ARC-AGI-3 pouvait être augmenté jusqu'à trois fois. Si même les « paramètres » peuvent faire une triple différence, alors comment devrions-nous mesurer l’écart réel de capacités entre les modèles ?

Qu'est-ce que l'ARC-AGI-3

ARC-AGI (Abstraction and Reasoning Corpus for AGI) est une référence importante pour mesurer la capacité d'un modèle à « résoudre de nouveaux problèmes/raisonnement abstrait » et est largement considéré comme une référence pour le « raisonnement abstrait de type humain ». Sa troisième génération (ARC-AGI-3) impose des exigences plus élevées en matière de capacités de généralisation et de raisonnement du modèle. OpenAI a découvert que certains paramètres d'inférence/décodage (généralement liés au budget d'inférence, à la stratégie de recherche ou à l'échantillonnage) avaient un impact énorme sur les performances : l'ajustement de seulement deux éléments entraînait un triplement.

Un rappel méthodologique

La valeur fondamentale de ce rapport ne réside pas dans les résultats, mais dans le rappel méthodologique : La « capacité réelle » du modèle est fortement liée au « cadre d'évaluation », et les résultats de l'évaluation doivent être sous une configuration unifiée avant de pouvoir être comparés horizontalement. Cela ébranle directement le fondement de récits tels que « un certain modèle obtient X » : si quelqu'un d'autre utilise un budget d'inférence différent pour obtenir un score plus élevé, dans quelle mesure ce score est-il convaincant ?

La pertinence de ce rappel est évidente. Il y a quelques jours à peine (24 juillet), Anthropic, le vieux rival derrière ChatGPT, affirmait lors du lancement de Claude Opus 5 que son score ARC-AGI 3 était 3x supérieur à celui du meilleur modèle suivant. L'« attaque et la défense » entre OpenAI et Anthropic autour d'ARC-AGI-3 reflète exactement le statut de la « ligne de base d'inférence » en 2026 en tant que noyau du récit de capacité du modèle - mais cela rend également la question de « qui obtient un score élevé » de plus en plus confuse.

D'un point de vue industriel, ce rapport révèle un phénomène qui se propage : lorsque les scores de référence deviennent une arme marketing, les fabricants optimisent la « configuration » plutôt que les « capacités ». Il s'agit d'un avertissement important pour l'écosystème national d'évaluation des grands modèles : qu'il s'agisse d'une liste publique ou d'une évaluation interne, le « budget d'inférence, les paramètres d'échantillonnage et les protocoles d'évaluation » doivent être clairs et unifiés, sinon les scores deviendront simplement un jeu de chiffres dénué de sens. La véritable comparaison des capacités reviendra finalement à une « évaluation reproductible dans des conditions uniformes ».

Plusieurs orientations à suivre dans le futur :

  1. Le contenu spécifique de « deux paramètres » : indique si OpenAI divulguera les détails complets des paramètres pour la reproduction.
  2. Consensus de l'industrie sur les spécifications d'évaluation : Y aura-t-il un protocole d'évaluation ARC-AGI-3 unifié.
  3. Réponse d'Anthropic : Comment le score ARC-AGI 3 de l'Opus 5 s'auto-certifie-t-il face aux doutes sur la "dépendance de la configuration".
  4. Révision des normes d'évaluation nationales : indique si la liste publique resserrera les exigences de divulgation pour les configurations d'évaluation.
Copyright : Contenu source Actualités officielles d'OpenAI (Recherche) . Cette plateforme a compilé et organisé ce contenu à des fins d'information et d'échange éducatif. Pour tout problème de droit d'auteur, veuillez nous contacter.

Avis

  • Chargement des avis...