大規模言語モデルにおける創発的な内省的認識
Emergent Introspective Awareness in Large Language Models
本研究では、大規模言語モデル(LLM)が自身の内部状態を内省できるかを調査した。会話だけでは、真の内省とこじつけを区別することが困難であるため、モデルの活性化に既知の概念の表現を注入し、これらの操作がモデルの自己報告状態に与える影響を測定することでこの課題に対処した。その結果、モデルは特定のシナリオにおいて、注入された概念の存在に気づき、それらを正確に特定できることがわかった。また、モデルは過去の内部表現を思い出し、それを生のテキスト入力と区別する能力を示した。特に、一部のモデルは、過去の意図を思い出す能力を利用して、自身の出力と人工的な事前設定を区別できることが判明した。これらの実験すべてにおいて、テストした中で最も有能なモデルであるClaude Opus 4および4.1は、一般的に最も高い内省的認識を示したが、モデル間の傾向は複雑で、トレーニング後の戦略に敏感であった。さらに、モデルが内部表現を明示的に制御できるかを調査し、モデルは概念について「考える」ように指示または奨励された場合に活性化を調整できることがわかった。全体として、現在の言語モデルは自身の内部状態に対してある程度の機能的な内省的認識を持っていることが示唆された。ただし、今日のモデルでは、この能力は非常に信頼性が低く、文脈依存的であるが、モデル能力のさらなる改善とともに発展する可能性がある。
- LLMが自身の内部状態を内省できるかを調査した研究で、モデルは注入された概念の存在に気づき、それを正確に特定できることが実証された。
- テストした中で最も有能なモデルであるClaude Opus 4および4.1が、一般的に最も高い内省的認識を示した。
- モデルは内部表現を明示的に制御でき、概念について「考える」ように指示された場合に活性化を調整できることがわかった。
LLMの内省的認識(メタ認知)能力を評価した研究で、モデルが自身の内部状態を認識・操作できることを実証した点は、AIエージェントの信頼性・安全性・透明性の向上に直結するテーマ。Claude Opus 4/4.1が最高性能を示したことで、Anthropicの技術的優位性が示唆される一方、モデル間の傾向はトレーニング後の戦略に敏感で、性能差が明確に安定していない点に留意が必要。AIモデルの能力評価・安全性研究の進展として投資判断の材料になる。