GPT-5.5 Instant の健康評価機能は飛躍的に向上し、医師の評価は人間の評価を上回りました

GPT-5.5 Instant は、HealthBench および HealthBench Professional ベンチマークで最先端のパフォーマンスに達し、医師の二重盲検評価では人間の医師の回答よりも優れた回答が得られます。

OpenAI は、健康評価における大きな進歩である GPT-5.5 Instant を発表しました。このモデルは、HealthBench ベンチマークと HealthBench Professional ベンチマークの両方で最先端のパフォーマンスに達しています。さらに驚くべきことに、医師が実施した二重盲検評価では、GPT-5.5 Instant の回答が人間の医師の回答よりも優れていることが判明しました。

HealthBench は、内科、小児科、外科などの一般的な診療科を含む複数の医療分野の基礎知識評価をカバーしています。 HealthBench Professional は、より専門的な医療サブ分野に焦点を当て、専門的な診断と治療計画の推奨におけるモデルの能力をテストします。

OpenAIは、この改善はGPT-5.5トレーニングプロセス中の医学文献と臨床ガイドラインの深層強化学習によるものだと述べた。モデルは医学的な質問に答えることができるだけでなく、複雑な臨床推論タスク全体で一貫性を維持することもできます。

この機能は ChatGPT に統合されており、ユーザーは会話の中で健康関連情報にアクセスできるようになります。しかしOpenAIは、これは依然として補助ツールであり医療機器ではなく、専門的な医療アドバイスの代わりとして使用すべきではないと強調している。

医療 AI は、大手モデル メーカーが競争する重要な垂直分野です。医師による二重盲検評価における GPT-5.5 Instant の「人間よりも優れた」パフォーマンスは、業界の画期的な成果です。臨床知識の質問と回答において、一般的な会話モデルがこの閾値を超えたのはこれが初めてです。国内の医療 AI トラックにとって、これは追いつきの目標であると同時に警告でもあります。専門分野における一般的な大規模モデルの詳細な機能が、疾患固有のモデルの利点領域を急速に突破しつつあります。

著作権:コンテンツソース OpenAI公式ブログ 。このプラットフォームは、情報提供と学習交流の目的でコンテンツを編集・整理しています。著作権に関する問題がございましたら、お問い合わせください。

レビュー

  • レビューを読み込み中...