OpenAI lance LifeSciBench : un benchmark d'IA en sciences de la vie rédigé et évalué par des experts
OpenAI lance LifeSciBench, qui contient 750 tâches rédigées par des experts et 19 020 critères de notation précis pour évaluer scientifiquement les véritables capacités de l'IA dans les sciences de la vie.
OpenAI publie LifeSciBench, un benchmark d'IA en sciences de la vie rédigé et révisé par des experts du domaine. LifeSciBench contient 750 tâches d'évaluation extraites d'activités de recherche scientifique réelles, couvrant des domaines tels que la biologie moléculaire, la biochimie, la génétique et la découverte de médicaments.
LifeSciBench est unique dans sa méthodologie d'évaluation : chaque tâche est accompagnée d'une grille de notation fine développée par une équipe d'évaluateurs experts, totalisant 19 020 points de notation. Cela garantit l'objectivité et l'exactitude de l'évaluation et évite le problème courant de « brosser les classements » dans les tests de référence traditionnels.
OpenAI a également publié GPT-Rosalind, une version de modèle spécifique aux sciences de la vie basée sur GPT-5.5, qui a obtenu des résultats de premier plan sur LifeSciBench. OpenAI a déclaré que LifeSciBench sera ouvert au monde universitaire pour promouvoir une évaluation standardisée de l'IA dans les sciences de la vie.
Le lancement de LifeSciBench comble le manque d’évaluation standardisée de l’IA dans les sciences de la vie. L'idée de conception selon laquelle les 750 tâches proviennent d'activités de recherche scientifique réelles mérite d'être référencée par les institutions nationales d'évaluation de l'IA - non pas des « questions d'examen » artificiellement construites, mais des « questions pratiques » de première ligne. Cela signifie que les modèles évalués via LifeSciBench fonctionneront de manière plus prévisible dans des scénarios de recherche scientifique réels.
Avis