OpenAI, 전문가가 작성하고 전문가가 검토한 생명과학 AI 벤치마크인 LifeSciBench 출시

OpenAI는 생명과학에서 AI의 진정한 역량을 과학적으로 평가하기 위해 전문가가 작성한 750개의 작업과 19,020개의 세분화된 채점 기준을 포함하는 LifeSciBench를 출시합니다.

OpenAI는 도메인 전문가가 작성하고 검토한 생명과학 AI 벤치마크인 LifeSciBench를 출시합니다. LifeSciBench에는 분자 생물학, 생화학, 유전학 및 약물 발견과 같은 분야를 다루는 실제 과학 연구 활동에서 추출된 750개의 평가 작업이 포함되어 있습니다.

LifeSciBench는 평가 방법이 독특합니다. 각 작업에는 전문 검토자 팀이 개발한 세분화된 채점 기준표가 함께 제공되며 총 19,020점을 획득합니다. 이는 평가의 객관성과 정확성을 보장하고 기존 벤치마크 테스트에서 "순위를 바꾸는" 일반적인 문제를 방지합니다.

OpenAI는 또한 GPT-5.5를 기반으로 한 생명과학 전용 모델 버전인 GPT-Rosalind를 출시하여 LifeSciBench에서 선도적인 결과를 달성했습니다. OpenAI는 LifeSciBench가 생명 과학 분야에서 AI의 표준화된 평가를 촉진하기 위해 학계에 공개될 것이라고 밝혔습니다.

LifeSciBench의 출시는 생명과학 분야의 표준화된 AI 평가 격차를 메워줍니다. 750개의 과제가 모두 실제 과학 연구 활동에서 나온다는 디자인 아이디어는 인위적으로 구성한 '시험 문제'가 아닌 최전선에서 '실천 문제'를 만들어 국내 AI 평가기관에서 참고할 만하다. 이는 LifeSciBench를 통해 평가된 모델이 실제 과학 연구 시나리오에서 더 예측 가능하게 수행된다는 것을 의미합니다.

저작권: 콘텐츠 출처 OpenAI 공식 블로그 . 이 플랫폼은 정보 제공 및 학습 교류를 목적으로 콘텐츠를 편집 및 정리했습니다. 저작권 문제가 있으시면 연락해 주세요.

후기

  • 후기를 불러오는 중...