OpenAI が LifeSciBench をリリース: 専門家が作成し、専門家がレビューしたライフ サイエンス AI ベンチマーク
OpenAI は、ライフ サイエンスにおける AI の真の能力を科学的に評価するための、専門家が作成した 750 のタスクと 19,020 のきめ細かい採点基準を含む LifeSciBench をリリースします。
OpenAI は、分野の専門家によって作成およびレビューされたライフ サイエンス AI ベンチマークである LifeSciBench をリリースします。 LifeSciBench には、分子生物学、生化学、遺伝学、創薬などの分野をカバーする、実際の科学研究活動から抽出された 750 の評価タスクが含まれています。
LifeSciBench は、その評価方法が独特です。各タスクには、専門家レビュー担当者のチームによって開発された、合計 19,020 のスコアリング ポイントを持つ、きめ細かいスコアリング ルーブリックが付いています。これにより、評価の客観性と精度が確保され、従来のベンチマーク テストでよくある「ランキングのブラッシュアップ」という問題が回避されます。
OpenAI は、GPT-5.5 に基づくライフ サイエンス固有のモデル バージョンである GPT-Rosalind もリリースしました。これは、LifeSciBench で優れた結果を達成しました。 OpenAIは、LifeSciBenchはライフサイエンスにおけるAIの標準化された評価を促進するために学界にオープンになると述べた。
LifeSciBench の開始により、ライフ サイエンスにおける AI の標準化された評価のギャップが埋められます。 750のタスクすべてが実際の科学研究活動から得られたという設計思想は、人為的に作られた「試験問題」ではなく、現場からの「実践問題」として、国内のAI評価機関が参考にする価値がある。これは、LifeSciBench を通じて評価されたモデルが実際の科学研究シナリオでより予測どおりに動作することを意味します。
レビュー