人間的な説明可能性のブレークスルー: クロードは自分の中に「グローバル ワークスペース」の考え方を持っています

Anthropic Interpretability Team は 7 月 6 日に「言語モデルにおけるグローバル ワークスペース」という研究結果を発表しました。クロードの内部に「メンタル ワークスペース」が出現し、出力には現れない内部思考が保持されます。 LLM 推論メカニズムを理解するための新しい証拠を提供します。

2026 年 7 月 6 日、人間解釈可能性チームは「言語モデルにおけるグローバル ワークスペース」という研究を発表し、かなり破壊的な発見をしました。Claude 内部に「メンタル ワークスペース」が出現し、モデルの出力には現れない内部思考が保持されます。

この研究でわかったこと

平たく言えば、研究者らは、答えを生成するプロセスにおいて、Claude が内部的に単に「1 つの入力、1 つの出力」であるのではなく、最終的な出力とは独立した「ワークスペース」が存在し、そこでモデルがユーザーに直接提示されない内部思考を実行することを発見しました。この発見は、大規模な言語モデルの推論メカニズムを理解するための新しい証拠を提供します。モデルは「答えを暗唱」しているのではなく、内部空間で「動作」して結論を​​与えています。

解釈可能性の研究にとって、これは非常に重要です。モデルの「思考プロセス」を特定して読み取ることができれば、調整、セキュリティ監査、およびエラー診断の新しい出発点が得られます。もはや出力だけでなく「プロセス」も見る必要があります。

過去 1 年間にわたる説明可能性研究の集中的な成果

この研究を Anthropic の 2026 年の研究スケジュールに戻すと、その継続的な投資がわかります。

日付 勉強
著作権:コンテンツソース 人類の公式研究 。このプラットフォームは、情報提供と学習交流の目的でコンテンツを編集・整理しています。著作権に関する問題がございましたら、お問い合わせください。

レビュー

  • レビューを読み込み中...