Sortie de Claude Opus 5 : approche de l'intelligence de pointe de Fable 5 à moitié prix, dépassant 4,8 en évaluation scientifique
Anthropic a sorti Claude Opus 5 le 24 juillet : au même prix que l'Opus 4.8, il rafraîchit SOTA sur plusieurs benchmarks tels que Frontier-Bench et CursorBench. Le score ARC-AGI 3 est 3 fois supérieur à celui du modèle sous-optimal, le qualifiant de modèle « d'alignement le plus élevé et de tromperie la plus faible de l'histoire ».
Anthropic a sorti une pièce d'échecs soigneusement calculée le 24 juillet : Claude L'Opus 5 est officiellement sorti - le prix est exactement le même que celui de l'Opus 4.8, mais les performances sont "proches du produit phare à moitié prix" et pénètrent dans les zones vierges de ses gammes de produits haut de gamme et milieu de gamme. Le positionnement officiel est très simple : c'est un modèle avant-gardiste utilisable au quotidien, et il est naturellement devenu le modèle par défaut de Claude Max et le modèle le plus puissant de Claude Pro.
Résultats de référence : SOTA vs "3x the next best"
Les données concrètes de l’Opus 5 laissent une note de bas de page « écrasante » sur presque toutes les échelles clés :
- Frontier-Bench v0.1 : surpasse tous les autres modèles et atteint plus de deux fois les performances de l'Opus 4.8 à un coût par tâche inférieur
- CursorBench 3.2 : l'effort le plus élevé n'est différent que de 0,5 % du pic de Fable 5, et le coût en représente la moitié.
- ARC-AGI 3 : scores 3x supérieurs à ceux du meilleur modèle suivant
- Zapier AutomationBench : pour le même coût de tâche unique, le taux de réussite est environ 1,5 fois supérieur à celui du modèle sous-optimal.
- OSWorld 2.0 : bat le meilleur résultat de Fable 5 pour plus d'un tiers du coût
L'évaluation scientifique est encore meilleure que 4,8 : toutes les évaluations des sciences de la vie sont supérieures, le score interne de la chimie organique est de 10,2 points de pourcentage supérieur à 4,8 et les tâches liées aux protéines sont de 7,7 points de pourcentage supérieures.
Tarification et nouvelles capacités d'ingénierie
Opus 5 est disponible sur toutes les plateformes à partir d'aujourd'hui, au prix de 5 $/million de jetons d'entrée, 25 $/million de jetons de sortie (identique à l'Opus 4.8) et propose un mode rapide (environ 2,5 fois plus rapide, 2 fois le prix). Deux versions bêta simultanées méritent l'attention de l'équipe d'ingénierie : Changements d'outils pendant la session (le cache d'invite ne sera plus invalidé, la structure de coûts des longues sessions sera considérablement améliorée) et Rollback automatique de l'API (une tentative officielle de rétrogradation de la tolérance aux pannes).
Au niveau de l'alignement, Anthropic a fait une déclaration rare : l'Opus 5 est son "modèle le plus aligné et le moins trompeur jamais créé", avec un score d'alignement de 2,3. Conformément au cadre industriel « Jailbreak Severity Score » promu le 30 juin, Anthropic commercialise les capacités de sécurité comme un argument de vente aux côtés des performances.
D'un point de vue industriel, la signification profonde de la position de la carte Opus 5 est que tandis que Fable 5 (phare de pointe) et Sonnet 5 (force principale à grande échelle) occupent respectivement les deux extrémités, l'Opus 5 remplit le milieu de gamme avec le « produit phare à moitié prix ». Il s'agit en fait d'une réponse miroir directe à la tarification à trois niveaux d'OpenAI GPT-5.6 (Sol/Terra/Luna). Pour les développeurs, les fabricants des deux côtés de cet équilibre « coût-capacité » confient le choix à la même variable : le coût en dollars par unité d'intelligence.
Plusieurs orientations à suivre dans le futur :
- Méthodologie d'évaluation ARC-AGI 3 : Après qu'OpenAI ait divulgué « deux paramètres triplent le score » le 29 juillet, la comparabilité horizontale des chiffres ARC-AGI 3 de chaque entreprise doit être réexaminée.
- Le véritable impact sur les coûts des modifications apportées aux outils en cours de session : le taux de rétention du cache rapide est la principale variable de coût pour les tâches longues de l'agent.
- Pénétration de l'Opus 5 dans les scénarios de calcul scientifique : Le leadership en matière d'évaluations des sciences de la vie peut-il se traduire par des achats réels par les clients médicaux et biopharmaceutiques.
- Actions de suivi de Fable 5 : Une fois que le produit phare aura été « approché à moitié prix », le rythme de mise à niveau du produit phare de nouvelle génération d'Anthropic sera forcé d'avancer.
Avis