Arène Gratuit

-

Arena (anciennement LMArena / LMSYS Chatbot Arena) est une plateforme communautaire d'examen de l'IA lancée par l'équipe de recherche de l'UC Berkeley. Grâce au mode Battle et au mécanisme de vote de la communauté, les utilisateurs peuvent comparer la qualité de sortie de différents modèles dans des scénarios réels, formant ainsi un classement public basé sur plus de 82 millions de préférences humaines réelles. Couvrant les dimensions d'évaluation multimodale telles que le texte, le code, les images et les agents vidéo, il fournit également des services d'évaluation commerciale aux entreprises et aux laboratoires modèles.

Arène Interface du produit

Arène

Paramètres de base et statistiques d'Arena

Arena (anciennement LMArena / LMSYS Chatbot Arena) est une plateforme communautaire d'évaluation de l'IA fondée par l'équipe de recherche de l'UC Berkeley. Il se positionne officiellement comme une « plateforme communautaire pour comprendre les performances de l'IA dans le monde réel ». Il ne s'agit ni d'un assistant de dialogue IA ni d'un cadre de formation modèle, mais d'une infrastructure d'évaluation qui connecte les « producteurs de modèles » et les « consommateurs de modèles » - grâce à plus de 82 millions de votes humains réels, il forme un classement public couvrant des dimensions multimodales telles que le texte, le code, les images et les agents vidéo.

Projets Informations publiques
Positionnement officiel Plateforme d'évaluation de l'IA alimentée par la communauté
Prédécesseur LMSYS Chatbot Arène → LMArena (2025) → Arène (2026)
Dimensions de l'évaluation Texte, code (WebDev/Image-to-WebDev), génération/édition d'images, génération/édition de vidéos Vision, Document, Recherche, Agent
Taille de la communauté 10 millions + visiteurs actifs mensuels 700 millions + conversations 82 millions + votes
Modèle économique Niveau communautaire gratuit + service d'évaluation d'entreprise (évaluations AI)
Situation financière 100 millions de dollars de démarrage (2025.05) → 150 millions de dollars de série A (2026.01)
Chiffre d'affaires annualisé ARR de 100 millions de dollars (à compter du 2026.06, les services d'entreprise sont en ligne depuis 8 mois)
Lieu d'appartenance États-Unis (Berkeley, Californie)
Plateforme d'assistance Internet

Un bref commentaire : Arena est essentiellement un "champ d'évaluation de modèles d'IA" - il ne permet pas aux utilisateurs de choisir des modèles et de discuter, mais grâce au mode Bataille et au vote de la communauté, il change "quel modèle est le meilleur" d'une impression subjective à un consensus communautaire quantifiable.

Mécanisme de base : une fois que l'utilisateur a saisi le mot d'invite, le système affiche de manière anonyme le résultat des deux modèles et l'utilisateur vote pour la meilleure réponse en fonction de son propre jugement. Les résultats des votes déterminent les classements publics, tandis que des ensembles de données open source sont disponibles pour la recherche universitaire et industrielle. Ce mécanisme rend les résultats de l'évaluation plus proches des préférences humaines réelles plutôt que des indicateurs surajustés de références statiques.

Structure des revenus : Arena réalisera un chiffre d'affaires annualisé de 100 millions de dollars en juin 2026, seulement 8 mois après le lancement du service d'évaluation d'entreprise. La croissance provient principalement des services d'évaluation personnalisés de Model Lab et de l'assistance à la sélection pour les entreprises clientes : la série A de 150 millions de dollars a été codirigée par Felicis et UC Investments, avec la participation d'a16z, Kleiner Perkins, Lightspeed et d'autres.

Utilisateurs d’Arena et reconnaissance du marché

La reconnaissance d’Arena sur le marché vient de deux voies claires : l’effet d’échelle des données du côté de la communauté et la vérification commerciale du côté de l’entreprise.

Densité des données côté communauté : Selon les informations officielles, la plateforme compte un total de 700 millions + 82 millions de conversations + 10 millions + visiteurs actifs mensuels. L'importance de ces chiffres ne réside pas dans le trafic lui-même, mais dans la rareté des « données sur les préférences humaines » : la grande majorité des évaluations de modèles s'appuient sur des benchmarks statiques ou sur le LLM en tant que juge, tandis qu'Arena conserve le jugement des utilisateurs réels sur les tâches ouvertes. Arena a mis en open source le plus grand ensemble de données sur les préférences humaines sur HuggingFace (lmarena-ai), qui est cité par plusieurs laboratoires de modélisation et institutions universitaires.

Courbe de croissance du côté des entreprises : Le service d'évaluation d'entreprise a atteint 100 millions de dollars ARR 8 mois après son lancement, ce qui indique que les laboratoires modèles et les grandes entreprises ont une demande rigide d'une « évaluation indépendante et transparente basée sur de véritables retours humains ». Plus de 400 nouveaux modèles ont été évalués publiquement via Arena, couvrant à la fois les modèles open source et fermés. Le mode Agent a atteint plus de 5 millions de cycles d'interaction mensuels dans le mois suivant son lancement, avec une augmentation de 10 % d'une semaine à l'autre, ce qui prouve que l'évaluation des agents en plusieurs étapes est l'une des lacunes les plus urgentes du marché actuel.

Influence académique : L'équipe Arena a publié des articles sur la méthodologie d'évaluation lors de conférences de premier plan telles que ICML 2024 (article Chatbot Arena), NeurIPS 2023 (LLM-as-a-judge), ICLR 2025 (RouteLLM), ICML 2025 (Prompt-to-Leaderboard, Arena-Hard), et sa méthode de classement est devenue l'une des normes de facto dans la communauté.

Prérequis : La crédibilité de la plateforme d'évaluation repose sur la diversité des échantillons de vote, la neutralité des propos invités et la rigueur statistique de la méthode de classement. Les utilisateurs de la plateforme sont principalement des techniciens (la communauté X/Discord est active) et l'échantillon peut être biaisé en faveur de scénarios d'utilisation spécifiques. C’est un facteur à prendre en compte lors de l’interprétation du classement.

L'avantage de coût d'Arena

  • C-side/Individuel : Généralement, une version gratuite est fournie pour découvrir les fonctions de base, et l'utilisation à haute fréquence nécessite un abonnement payant.
  • API/Développeur : Facturé au volume d'appels, adapté aux équipes de développement qui peuvent être intégrées de manière flexible dans leurs propres systèmes.
  • Entreprise/Privatisé : contactez le propriétaire de l'entreprise pour un devis personnalisé et un plan de déploiement. Le prix spécifique est soumis à la page officielle de tarification en temps réel.

Principales caractéristiques d'Arena

La capacité d'Arena n'est pas « une boîte de discussion plus une liste de classement », mais un système complet construit autour d'un « retour d'information sur les données d'évaluation, de routage et de classement » :

  • Mode combat (comparaison de modèles anonymes) : l'utilisateur saisit un mot d'invite, deux modèles anonymes le produisent en même temps et l'utilisateur vote pour choisir la meilleure réponse. Il s’agit du principal mécanisme de collecte de données d’Arena. La conception clé est l'anonymat pour éliminer les préjugés de la marque, l'appariement aléatoire pour réduire le bruit de classement, et le système de notation ELO fournit des classements stables dans le temps. Lien caché : chaque vote génère trois valeurs en même temps : mise à jour des classements, formation du modèle de routage Max et expansion de l'ensemble de données open source. Il accomplit les trois tâches de collecte de données, d'optimisation du routage et de contribution à la communauté en une seule opération.

  • Système de classement multidimensionnel : il ne s'agit pas seulement d'un « classement global », mais divisé en plus de 13 classements subdivisés en fonction des capacités et des modes : Global, Agent, Texte, WebDev, Image-to-WebDev, Text-to-Image, Image Edit, Text-to-Video, Image-to-Video, Video Edit, Vision, Document, Search, etc. dans les scénarios WebDev. La liste de segmentation modifie la sélection de « sélection du meilleur modèle » à « sélection du modèle le plus adapté à cette tâche ».

  • Max Model Router : un moteur de routage intelligent formé sur plus de 5 millions de données de vote de la communauté qui distribue automatiquement les conseils des utilisateurs au modèle le plus approprié. Implications techniques : Max est essentiellement un « système de recommandation de modèles » basé sur la formation des préférences humaines. Son existence signifie qu'Arena n'est pas seulement une plate-forme d'évaluation, mais devient également progressivement la couche décisionnelle de la planification des modèles.

  • Mode Agent (évaluation de tâches en plusieurs étapes) : un nouveau mode d'évaluation lancé en juin 2026, mesurant le taux d'achèvement des tâches objectives et le taux d'hallucinations pour les scénarios d'agent. Contrairement aux benchmarks statiques traditionnels, le mode Agent évalue la capacité d'un modèle à effectuer une inférence en plusieurs étapes et un appel d'outils dans un contexte ouvert. Il a atteint plus de 5 millions d'interactions mensuelles dans le mois suivant son lancement, ce qui indique que la demande du marché pour l'évaluation des agents dépasse de loin les attentes.

  • Services d'évaluation d'entreprise (évaluations AI) : fournissez des évaluations personnalisées aux laboratoires et aux entreprises modèles, couvrant la vérification des modèles avant la publication, la comparaison des produits concurrents et l'analyse fine des capacités. Valeur fondamentale : les équipes d'évaluation internes sont souvent confrontées à des problèmes de taille d'échantillon insuffisante et de dimensions d'évaluation fixes. Le service d’entreprise d’Arena résout ces deux goulots d’étranglement en accédant à un véritable pool de votes humains.

Evolution du modèle et de la version d'Arena

Arena n'est pas le modèle d'IA lui-même, donc l'évolution de sa version se reflète dans l'expansion continue de la couche de fonctionnalités de la plate-forme :

  • 2025.09 Lancement du service d'évaluation d'entreprise : entrée officielle dans la phase de commercialisation à partir d'un pur projet communautaire, lancement du service d'évaluation personnalisé AI Evaluations.
  • 2025.11 Arena Expert : Le mode d'évaluation de niveau expert est introduit, la méthodologie d'évaluation et l'algorithme de classement sont systématiquement mis à niveau et la liste de classement est plus sensible aux petites différences entre les modèles.
  • Mise à niveau de la marque 2026.01 + Série A : LMArena est renommée Arena, se repositionnant d'une « arène de chatbot » à une plateforme d'évaluation d'IA plus large. Financement de série A de 150 millions de dollars complété au cours de la même période.
  • 2026.02 Max Model Router : sortie d'un moteur de routage intelligent formé sur la base de plus de 5 millions de votes de la communauté, marquant la transition des capacités d'Arena de « l'évaluation passive » à la « planification active ».
  • Extension multimodale 2026.05 : ajout des classements de subdivision Fullstack Code Arena (WebDev, Image-to-WebDev, etc.), publication de Multimodal Max pour prendre en charge le routage de modèles multimodaux.
  • Mode Agent 2026.06 : capacité d'évaluation d'agent en ligne, prenant en charge l'évaluation ouverte de tâches en plusieurs étapes, répondant directement au besoin urgent de l'industrie en matière d'évaluation de la fiabilité des agents.
  • Classement d'exactitude factuelle 2026.07 : ajout du classement de la réalité factuelle, introduisant la dimension de l'exactitude factuelle objective en plus des préférences humaines, en réponse au problème de longue date de la « difficulté d'évaluation des hallucinations » dans les modèles d'IA.

Ligne principale d'évolution : partant de « l'évaluation du dialogue textuel », elle couvre successivement des dimensions telles que le code, les images, les agents vidéo et la praticité, tout en s'étendant de « l'évaluation pure » à la relation commerciale « évaluation + routage + services d'entreprise ». Chaque mise à jour de version correspond à un point d’inquiétude dans l’industrie concernant l’évaluation de l’IA.

Les avantages techniques d'Arena

La valeur technique d'Arena ne réside pas dans les performances d'un modèle unique, mais dans la profondeur de la conception du système d'ingénierie d'évaluation et l'effet d'échelle du volant de données :

Rigueur statistique du système de classement ELO : Arena utilise un système de notation ELO amélioré pour réduire les biais de classement grâce à un appariement anonyme, un ordre aléatoire et un échantillonnage suffisant. Son document sur la méthodologie de classement a été examiné par des pairs par l'ICML et est statistiquement plus fiable que le simple taux de victoire ou la note moyenne. Chaîne causale : Méthodologie de classement rigoureuse → Classements plus crédibles → La communauté est plus disposée à participer au vote → Plus de données → Classements plus précis.

La rareté des données sur les préférences humaines à grande échelle : plus de 700 millions de conversations et plus de 82 millions de votes constituent l'un des plus grands ensembles de données ouverts sur les préférences humaines au monde. La valeur de ces données réside dans « tâches ouvertes + utilisateurs réels + préférences multidimensionnelles », ce qui diffère du risque de surajustement possible des benchmarks statiques (tels que MMLU, GSM8K). L'ensemble de données open source de HuggingFace est devenu une ressource d'aide à l'évaluation pour plusieurs laboratoires modèles.

Réutilisation technique du moteur de routage Max : le modèle de recommandation de Max est essentiellement un sous-produit des données de vote de la communauté : le même flux de données sert à la fois aux mises à jour de classement et à la formation du modèle de routage. Cela forme une boucle de rétroaction positive de « plus de votes → un routage plus précis → une meilleure expérience utilisateur → plus d'utilisateurs votent ». Du point de vue des coûts, le coût marginal de formation des capacités de routage est extrêmement faible car les données de formation sont générées à chaque instant par des utilisateurs gratuits.

Architecture unifiée pour l'évaluation multimodale : différentes modalités telles que le texte, le code, l'image et l'agent vidéo partagent le même cadre de base de "comparaison anonyme + vote humain + classement ELO", ce qui réduit le coût d'ingénierie lié à l'ajout de nouvelles dimensions d'évaluation. La particularité du mode Agent est l'introduction d'une mesure objective du taux d'achèvement, qui ajoute un taux de réussite des tâches quantifiable en plus des préférences subjectives. Cette idée de conception fournit une référence pour la normalisation ultérieure de l’évaluation.

Contraintes techniques : Le principal goulot d'étranglement du système d'évaluation n'est pas la mise en œuvre technique, mais la gouvernance de la manipulation contradictoire : comment empêcher le laboratoire modèle de manipuler les classements grâce à l'optimisation ciblée de mots d'invite spécifiques, comment détecter le brossage des votes et comment maintenir la neutralité et la fraîcheur du vocabulaire d'invite. Ces problèmes deviendront plus importants à mesure que la taille des communautés continuera de croître.

Comment utiliser Arena

Arena est principalement accessible via le Web, offrant plusieurs entrées pour répondre aux besoins des différents rôles :

Comment utiliser Convient à la foule Chemin d'opération Étapes typiques
Mode combat Tous les utilisateurs Page d'accueil d'arena.ai → Sélectionnez le type de tâche → Entrez le mot d'invite → Comparez la sortie anonyme → Votez Effectuer une comparaison de modèles en 1 minute
Conversation directe Utilisateurs ayant besoin d'un modèle spécifique arena.ai → Mode direct → Sélectionner le modèle → Entrer dans la conversation Equivalent à un client de chat multimodèle
Voir le classement Décideurs techniques arena.ai/leaderboard → Sélectionnez les dimensions (Global/Agent/Code, etc.) Voir sans inscription
Routage maximum Utilisateurs qui souhaitent obtenir automatiquement la meilleure réponse arena.ai → Mode Max → Entrez le mot d'invite Le système sélectionne automatiquement le modèle le plus approprié
Mode Agent Évaluer les tâches en plusieurs étapes arena.ai/agent → Définir les objectifs de la tâche → Observer le processus d'exécution du modèle Prise en charge de l'évaluation ouverte des tâches longues

Démarrage rapide pour les dirigeants : lorsque les décideurs techniques évaluent si Arena peut être utilisé comme outil d'évaluation, trois étapes seulement sont requises : ① Visitez arena.ai/leaderboard pour voir si la structure des classements segmentés couvre les dimensions de capacité qui vous intéressent ; ② Utilisez vos propres mots d'invite professionnels (plutôt que des mots d'invite généraux) pour comparer 10 à 20 fois en mode Bataille afin de déterminer si la différence de résultats est cohérente avec l'expérience réelle ; ③ Contactez é[email protected] pour en savoir plus sur la portée de personnalisation et le schéma d'isolation des données de l'évaluation d'entreprise.

Chemin de consommation des données : les chercheurs et les équipes d'analyse de produits concurrents peuvent télécharger directement l'ensemble de données open source (lmarena-ai) sur HuggingFace, qui contient des enregistrements de vote anonymes complets et des résultats de modèle pour une analyse secondaire et des calculs de classement personnalisés.

Tarifs des produits Arena

Le modèle de tarification est soumis à la page officielle en temps réel. Habituellement, un système freemium ou d’abonnement est adopté. Les fonctions de base peuvent être utilisées gratuitement, tandis que les fonctions avancées ou une utilisation à haute fréquence nécessitent des abonnements payants. Il est recommandé aux utilisateurs d'évaluer la solution optimale en fonction de l'utilisation réelle.

Scénarios d'application d'arène

Les capacités de l’infrastructure d’évaluation d’Arena peuvent être intégrées à divers liens décisionnels :

  • Sélection de modèles et décision d'approvisionnement : avant d'acheter ou d'accéder à des modèles d'IA, les entreprises peuvent rapidement affiner les candidats grâce aux classements Arena et aux comparaisons personnalisées. Conseil de mise en œuvre : La valeur des classements segmentés est supérieure au classement global. Par exemple, si le scénario principal est la génération de code frontal, vous devez vous concentrer sur les classements WebDev et Image-to-WebDev plutôt que sur le classement global. Il est recommandé d'utiliser Arena pour une sélection préliminaire dans un premier temps, puis d'utiliser des modèles candidats pour effectuer des tests A/B à petite échelle sur vos propres données commerciales afin de prendre la décision finale.

  • Vérification itérative dans Model Lab : l'équipe de développement de modèles obtient des évaluations indépendantes et tierces des préférences humaines via le service d'évaluation d'entreprise d'Arena avant la sortie pour vérifier l'effet des améliorations de version. Réduction des coûts et amélioration de l'efficacité : les modèles traditionnels doivent constituer leur propre équipe d'évaluation et leur propre plate-forme d'annotation avant de les publier, et cela prend généralement 3 à 6 mois entre leur création et leur sortie. Grâce aux évaluations d'entreprise Arena, ce cycle peut être réduit à 2 à 4 semaines, et le coût des évaluations est réduit de plusieurs centaines de milliers de dollars au niveau des frais annuels convenus dans le contrat.

  • Évaluation de la fiabilité des agents et des tâches en plusieurs étapes : avec l'explosion des produits Agent, l'évaluation traditionnelle en une seule étape ne peut plus couvrir les scénarios de raisonnement en plusieurs étapes et d'appel d'outils. Le mode Agent d'Arena fournit des contextes de tâches ouverts, qui peuvent être utilisés pour évaluer des indicateurs objectifs tels que le taux d'exécution des commandes des agents du service client et le taux de réussite de la construction des agents de code. Points douloureux du scénario : la plus grande difficulté dans l'évaluation des agents est que le « étalon-or » est difficile à définir : pour la même tâche, différents chemins d'exécution peuvent être corrects. Le mode Agent Arena atténue ce problème en introduisant une évaluation hybride du jugement humain + des taux d’achèvement des objectifs.

  • Évangélisation de l'éducation et de la technologie : dans les scénarios d'enseignement, le mode Bataille d'Arena peut afficher visuellement les différences dans la façon dont différents modèles traitent le même mot d'invite, aidant ainsi les étudiants à comprendre les limites des capacités du modèle. La taille de la communauté de plus de 10,1 millions de visiteurs actifs mensuels reflète également sa pénétration sur la scène éducative.

Personnes concernées pour Arena

La conception des capacités multicouches d'Arena remplit quatre types de rôles distincts, chaque couche ayant des profondeurs d'utilisation et des avantages différents :

  • Chefs de produits IA et décideurs techniques : personnes qui doivent effectuer la sélection des modèles. La valeur fondamentale d’Arena est de fournir des données d’évaluation tierces indépendantes des fabricants de modèles. Chemin recommandé : utilisez d'abord la liste de classement pour affiner la portée des candidats (1 jour), puis utilisez le mode Bataille pour effectuer une vérification à petite échelle avec vos propres données de scène (3 à 5 jours), et enfin contactez l'évaluation d'entreprise pour une évaluation approfondie (1 à 2 semaines). Limite inappropriée : si votre scène est très verticale (comme un diagnostic d'imagerie médicale, un examen de documents juridiques), les données d'évaluation générales d'Arena peuvent ne pas être suffisamment précises et vous devez effectuer des évaluations personnalisées sur vos propres ensembles de données.

  • Développeurs de modèles et chercheurs en IA : personnes qui doivent vérifier l'effet d'itération des versions de modèles. Les évaluations d'entreprise d'Arena complètent les dimensions réelles des préférences humaines qui sont difficiles à couvrir pour les équipes d'évaluation internes. Les ensembles de données open source constituent également une ressource précieuse pour la recherche sur les méthodologies de classement, l'alignement des préférences et les techniques d'évaluation des modèles.

  • Équipe d'approvisionnement et de conformité de l'entreprise : groupe de personnes qui doivent sélectionner un fournisseur d'IA pour l'organisation. Les classements segmentés et la méthodologie publique d’Arena fournissent du matériel de démonstration de sélection réutilisable. Ne convient pas aux limites : les données de la plateforme d'évaluation ne constituent pas une évaluation complète de la sécurité du modèle - si votre scénario implique des données sensibles ou des exigences de conformité strictes (telles que HIPAA, RGPD), des audits de sécurité indépendants et des examens de conformité sont toujours requis.

  • Passionnés d'IA et premiers utilisateurs : découvrez les différences entre les capacités des modèles de pointe grâce au mode Bataille, avec un accès gratuit à plusieurs modèles. Ces utilisateurs sont également des contributeurs majeurs aux données de vote de la plateforme.

Résumé et perspectives d'Arena

La principale compétitivité d'Arena réside dans le modèle à deux roues « volant de données communautaire + service d'évaluation commerciale » - plus de 82 millions de votes humains réels constituent une barrière de données extrêmement élevée, et la croissance rapide des services d'évaluation d'entreprise (100 millions de dollars ARR en 8 mois) vérifie la capacité de monétisation de cet actif du côté commercial. Le chemin d'expansion des capacités, du texte à l'agent puis aux faits, montre qu'Arena évolue d'une « arène de discussion modèle » à une « infrastructure d'évaluation complète des capacités de l'IA ».

Limites et incertitudes actuelles : ① Le biais de l'échantillon du classement : les utilisateurs actifs sont principalement des utilisateurs techniques et des premiers utilisateurs, et peuvent ne pas représenter les préférences des utilisateurs universels ; ② Le risque de manipulation contradictoire - à mesure que l'influence commerciale des classements augmente, le laboratoire modèle est incité à optimiser les mots-clés des classements, et la méthode de classement doit continuer à lutter contre cet effet Goodhart ; ③ La capacité de déploiement privatisée n'est pas divulguée - les entreprises ayant des exigences élevées en matière de souveraineté des données doivent confirmer si Arena prend en charge des contextes d'évaluation complètement isolés ; ④ Couverture multilingue - les données d'évaluation actuelles sont principalement en anglais et la fiabilité des classements dans des scénarios non anglais tels que le chinois doit être vérifiée.

Évaluation des risques d'approvisionnement/d'adoption : en tant qu'outil de référence pour la comparaison de modèles, Arena est extrêmement rentable : le niveau gratuit couvre déjà la fonctionnalité de comparaison de base. Cependant, pour les achats au niveau de l'entreprise, il est recommandé de procéder en trois étapes : ① Utiliser d'abord le niveau gratuit pour vérifier la cohérence des données de classement et de l'expérience réelle dans 2 à 3 scénarios principaux (1 mois) ; ② Si des capacités d'évaluation plus fines sont nécessaires, contactez l'équipe d'évaluation de l'entreprise pour demander des solutions personnalisées et référencer des cas clients ; ③ Avant de signer un contrat, concentrez-vous sur la confirmation de l'isolement des données, de l'attribution des résultats et des conditions d'exclusivité, et exigez un SLA couvrant le temps de réponse de l'évaluation et la garantie de disponibilité des données. La décision de sélection finale ne doit pas uniquement s’appuyer sur les données d’évaluation d’Arena, mais doit également être combinée avec les résultats de mesure réels de ses propres scénarios commerciaux et d’évaluations de sécurité indépendantes.

Outils associés : deepseek, chatgpt

Comment utiliser Arena

  • Client Web : Vous pouvez l'utiliser en visitant le site officiel et en créant un compte. La plupart des fonctions ne nécessitent pas d'installation.
  • Accès API : fournit une API RESTful, les développeurs peuvent obtenir la clé API et l'intégrer dans leurs propres applications.

Informations de version

  • Plateforme Arena (mode agent + classement factuel) :Ajout d'un nouveau classement Factuality, extension des capacités d'évaluation du mode Agent à plus de 5 millions de cycles d'interaction mensuels et poursuite de l'amélioration de la couverture d'évaluation multimodale.
  • Mode Agent + Arène de code Fullstack :Mode Agent libéré pour prendre en charge l'évaluation du taux d'achèvement objectif et du taux d'hallucinations de tâches complexes en plusieurs étapes ; a lancé le classement Fullstack Code Arena.
  • Nouvelles catégories + Multimodal Max :Ajout des classements des subdivisions Code Arena (WebDev / Image-to-WebDev, etc.) ; a publié les capacités de routage du modèle multimodal Multimodal Max.
  • Modèle maximum de routeur :Lancement du moteur de routage de modèle Max qui achemine automatiquement les invites des utilisateurs vers le modèle le plus approprié sur la base de plus de 5 millions de votes de la communauté.
  • Changement de nom de LMArena → Arène :LMArena a officiellement changé son nom pour Arena, complétant ainsi la mise à niveau de la marque et l'expansion des produits. Au cours de la même période, elle a finalisé un financement de série A de 150 millions de dollars américains.
  • Expert en arène :Lancement du mode d'évaluation de niveau expert Arena Expert et introduction de dimensions d'évaluation des capacités de domaine plus raffinées et de mises à jour de la méthodologie de classement.
  • Lancement de l'évaluation d'entreprise :Service d'évaluation commerciale officiellement lancé (AI Évaluations) pour fournir une évaluation de modèles personnalisée aux entreprises et aux laboratoires modèles.

Avis des utilisateurs

  • Chargement des avis...