Les capacités d'évaluation de la santé de GPT-5.5 Instant ont bondi et les évaluations des médecins dépassent celles de leurs homologues humains.

GPT-5.5 Instant atteint des performances de pointe selon les critères de référence HealthBench et HealthBench Professional, avec des réponses meilleures que celles des médecins humains lors d'évaluations médicales en double aveugle.

OpenAI annonce GPT-5.5 Instant, une avancée majeure dans l'évaluation de la santé. Le modèle atteint des performances de pointe sur les benchmarks HealthBench et HealthBench Professional. Plus frappant encore, lors d'évaluations en double aveugle menées par des médecins, les réponses de GPT-5.5 Instant se sont révélées meilleures que celles des médecins humains.

HealthBench couvre l'évaluation des connaissances de base dans plusieurs domaines médicaux, y compris des départements communs tels que la médecine interne, la pédiatrie et la chirurgie. HealthBench Professional se concentre sur des sous-domaines médicaux plus professionnels, testant la capacité du modèle en matière de diagnostic spécialisé et de recommandations de plans de traitement.

OpenAI a déclaré que cette amélioration est due à un apprentissage approfondi par renforcement de la littérature médicale et des directives cliniques au cours du processus de formation GPT-5.5. Les modèles sont non seulement capables de répondre à des questions médicales, mais également de maintenir la cohérence entre des tâches de raisonnement clinique complexes.

Cette fonctionnalité a été intégrée à ChatGPT, permettant aux utilisateurs d'accéder à des informations liées à la santé dans les conversations. Mais OpenAI souligne qu’il s’agit toujours d’un outil auxiliaire, et non d’un dispositif médical, et ne doit pas être utilisé comme substitut à un avis médical professionnel.

L’IA médicale est un domaine vertical clé pour lequel les grands fabricants de modèles sont en concurrence. Les performances « supérieures à l'humain » de GPT-5.5 Instant dans les évaluations en double aveugle réalisées par des médecins constituent un tournant dans l'industrie : c'est la première fois qu'un modèle de conversation général franchit ce seuil en matière de questions et réponses sur les connaissances cliniques. Pour le secteur national de l'IA médicale, il s'agit à la fois d'un objectif de rattrapage et d'un avertissement : les capacités approfondies des grands modèles généraux dans les domaines professionnels dépassent rapidement les domaines avantageux des modèles spécifiques à des maladies.

Copyright : Contenu source Blog officiel d'OpenAI . Cette plateforme a compilé et organisé ce contenu à des fins d'information et d'échange éducatif. Pour tout problème de droit d'auteur, veuillez nous contacter.

Avis

  • Chargement des avis...