인류학적 설명 가능성의 혁신: Claude는 내부적으로 생각하는 "글로벌 작업 공간"을 가지고 있습니다.

인류 해석 팀은 7월 6일 "언어 모델의 글로벌 작업 공간"에 대한 연구를 발표했습니다. 클로드 내부에 "정신적 작업 공간"이 나타나 출력에는 나타나지 않는 내부 사고를 보유하고 있습니다. LLM 추론 메커니즘을 이해하기 위한 새로운 증거를 제공합니다.

2026년 7월 6일, Anthropic Interpretability 팀은 "언어 모델의 글로벌 작업 공간"에 대한 연구를 발표하고 다소 파괴적인 발견을 했습니다. Claude 모델 출력에는 나타나지 않는 내부 사고를 담는 "정신적 작업 공간"이 내부에 나타났습니다.

이 연구에서 발견한 내용

연구자들은 답변을 생성하는 과정에서 Claude가 내부적으로 단순히 "하나의 입력, 하나의 출력"이 아니라 최종 출력과 독립된 "작업 공간"이 있으며, 여기서 모델은 사용자에게 직접 제시되지 않는 내부 사고를 수행한다는 사실을 발견했습니다. 이 발견은 대규모 언어 모델의 추론 메커니즘을 이해하기 위한 새로운 증거를 제공합니다. 모델은 "답을 낭독"하는 것이 아니라 결론을 내리기 위해 내부 공간에서 "작동"합니다.

해석 가능성 연구에 있어 이는 매우 중요합니다. 모델의 "사고 프로세스"를 찾아 읽을 수 있다면 정렬, 보안 감사 및 오류 진단을 위한 새로운 출발점이 있을 것입니다. 더 이상 출력만 보는 것이 아니라 "프로세스"도 살펴보는 것입니다.

지난 1년간 집중적인 설명 가능성 연구 성과

이 연구를 Anthropic의 2026년 연구 일정에 다시 포함시키는 것은 Anthropic의 지속적인 투자를 보여줍니다.

날짜 연구
저작권: 콘텐츠 출처 인류 공식 연구 . 이 플랫폼은 정보 제공 및 학습 교류를 목적으로 콘텐츠를 편집 및 정리했습니다. 저작권 문제가 있으시면 연락해 주세요.

후기

  • 후기를 불러오는 중...