Latent Agents: 内部化されたマルチエージェント討論のための訓練後手順
Latent Agents: A Post-Training Procedure for Internalized Multi-Agent Debate
大規模言語モデル(LLM)の推論能力向上にマルチエージェント討論が有効であることが示されているが、計算コストが高い。この非効率性を解消するため、本研究では2段階のファインチューニングパイプラインを通じてマルチエージェント討論を単一LLMに蒸留するフレームワークを開発した。このフレームワークは、討論構造学習と、動的報酬スケジューリングおよび長さクリッピングによる内部化を組み合わせる。複数のモデルとベンチマークにおいて、内部化されたモデルは、明示的なマルチエージェント討論と同等以上の性能を、トークン数を最大93%削減して達成した。さらに、活性化ステアリングによるメカニズム的基盤の調査により、内部化がエージェント固有のサブスペース(異なるエージェントの視点に対応する解釈可能な方向)を生成することが明らかになった。また、悪意のあるエージェントをLLMに内部化討論を通じて注入し、ネガティブステアリングを適用して抑制する実用的な応用も示された。この蒸留により、ベースモデルをステアリングする場合と比較して、一般的な性能の低下をより小さく抑えつつ、有害な挙動を局所化・制御することが容易になる。本研究は、蒸留モデルにおけるマルチエージェント能力の理解に新たな視点を提供し、内部化された推論行動の制御に関する実用的な指針を提供する。
- 大規模言語モデルにマルチエージェント討論を蒸留する「Latent Agents」フレームワークが提案された
- 内部化モデルが明示的マルチエージェント討論と同等以上の性能を達成し、トークン数を最大93%削減したことが示された
- 悪意のあるエージェントをLLMに注入し、ネガティブステアリングで抑制する実用的応用が示された
本論文は、マルチエージェント討論の高性能を保ちながら計算コストを最大93%削減する「内部化」手法を提案しており、LLM推論の効率化に大きなインパクトがある。特に、悪意あるエージェントの注入とネガティブステアリングによる制御という安全性への応用も示されており、AIエージェントの実用化・商用化が加速する段階において、コスト削減と制御性向上の両面で重要な技術進展といえる。投資家としては、この蒸留技術を採用するLLMプラットフォームや、エージェント安全性ソリューションを提供するスタートアップの競争力強化に注目したい。