OpenAI는 "두 가지 설정"으로 ARC-AGI-3 점수를 3배로 높였습니다. 벤치마크는 신뢰 위기에 직면했습니다.
OpenAI는 7월 29일 연구 보고서를 발표하여 "두 가지 설정"이 ARC-AGI-3 벤치마크에서 모델 점수를 3배로 높일 수 있음을 밝히고 평가 결과가 추론/디코딩 설정과 밀접한 관련이 있음을 밝히고 업계에 "평가 구성 의존성"으로 인해 발생하는 잘못된 높은 결과에 주의할 것을 상기시켰습니다.
7월 29일, OpenAI는 "자신의 단점을 노출"하는 것처럼 보이는 연구 보고서를 발표했습니다. "두 가지 설정"을 통해 ARC-AGI-3 벤치마크에서 모델 점수를 3배까지 높일 수 있음을 밝혔습니다. "설정"만으로도 3배의 차이가 발생할 수 있다면 모델 간의 실제 성능 격차를 어떻게 측정해야 할까요?
ARC-AGI-3이란 무엇입니까?
ARC-AGI(Abstraction and Reasoning Corpus for AGI)는 모델의 "새로운 문제 해결/추상적 추론" 능력을 측정하는 중요한 벤치마크이며, "인간과 유사한 추상적 추론"에 대한 벤치마크로 널리 알려져 있습니다. 3세대(ARC-AGI-3)는 모델의 일반화 및 추론 기능에 대해 더 높은 요구 사항을 적용합니다. OpenAI는 특정 추론/디코딩 설정(일반적으로 추론 예산, 검색 전략 또는 샘플링과 관련됨)이 성능에 큰 영향을 미친다는 사실을 발견했습니다. 단 두 항목만 조정하면 3배의 성능 향상이 가능합니다.
방법론적 알림
이 보고서의 핵심 가치는 결과가 아니라 방법론적 알림에 있습니다. 모델의 "실제 성능"은 "평가 설정"과 밀접하게 관련되어 있으며 평가 결과는 수평적으로 비교되기 전에 통일된 구성 하에 있어야 합니다. 이는 "특정 모델의 점수 X"와 같은 서술의 기초를 직접적으로 흔듭니다. 다른 사람이 더 높은 점수를 실행하기 위해 다른 추론 예산을 사용한다면 이 점수는 얼마나 설득력이 있습니까?
이 알림의 타당성은 매우 분명합니다. 불과 며칠 전(7월 24일) ChatGPT의 오랜 라이벌인 Anthropic은 Claude Opus 5 출시 당시 자사의 ARC-AGI 3 점수가 다음 최고 모델보다 3배 더 높다고 주장했습니다. ARC-AGI-3을 중심으로 한 OpenAI와 Anthropic 간의 "공격과 방어"는 모델 능력 서술의 핵심인 2026년 "추론 기준"의 상태를 정확하게 반영하지만, "누가 높은 점수를 받는가"에 대한 질문을 점점 더 혼란스럽게 만듭니다.
업계 관점에서 볼 때, 이 보고서는 확산되고 있는 업계 현상을 보여줍니다. 즉, 벤치마크 점수가 마케팅 무기가 되면 제조업체는 "기능"보다는 "구성"을 최적화할 것입니다. 이는 국내 대형 모델 평가 생태계에 대한 중요한 경고입니다. 공개 목록이든 내부 평가이든 "추론 예산, 샘플링 설정 및 평가 프로토콜"이 명확하고 통일되어야 합니다. 그렇지 않으면 점수는 무의미한 숫자 게임이 될 것입니다. 진정한 능력의 비교는 결국 '균일한 조건에서 재현 가능한 평가'로 돌아가게 됩니다.
앞으로 추적할 가치가 있는 몇 가지 방향은 다음과 같습니다.
- "두 가지 설정"의 구체적인 내용: OpenAI가 재생산을 위해 전체 설정 세부 정보를 공개할지 여부.
- 평가 사양에 대한 업계 합의: 통일된 ARC-AGI-3 평가 프로토콜이 있는지 여부.
- Anthropic의 답변: Opus 5의 ARC-AGI 3 점수는 "구성 종속성" 의심에 직면하여 어떻게 자체 인증합니까?
- 국내 평가기준 개정: 공개목록의 평가구성 공개요건을 강화할지 여부.
후기