大規模言語モデルは、思考時間を長くすることで、直接思い出せない事実の最大65%を回復できる
Frontier models can recover up to 65% of facts they can't directly recall — just by thinking longer
Google ResearchとTechnionの研究者による新しい研究によると、大規模言語モデル(LLM)は、事実を直接思い出せない場合でも、その情報が欠落しているのではなく、モデル内にエンコードされているものの、生成時に表面化できない場合が多いことが示されました。GPT-5やGemini-3のような最先端モデルは、テストされた事実の95-98%をエンコードしていますが、そのうち26-34%を直接想起できません。しかし、推論時間中に思考(例:Chain-of-Thought)のような計算を行うことで、直接想起できなかったエンコード済み事実の40-65%を回復できることがわかりました。この研究では、モデルの知識を「エンコードされているか」と「知っているか」に区別し、評価方法を質問ごとの正答率から、単一の事実を様々な条件でテストする「ファクトレベル・プロファイリング」に移行することを提案しています。これにより、モデルの知識の格納(エンコード)と検索(想起)のギャップを特定し、外部データベースやモデルサイズの拡大に頼らず、より信頼性の高いアプリケーションを構築する道が開かれます。開発者に対しては、すべての事実誤認を検索問題として扱わず、推論時間中の思考を戦略的に使用し、ベンチマーク精度だけでなく意味的なアクセスをテストすることを推奨しています。
- Google ResearchとTechnionの研究で、GPT-5やGemini-3のような最先端モデルはテストされた事実の95-98%をエンコードしているが、そのうち26-34%を直接想起できないことが判明
- 推論時間中にChain-of-Thought等の思考計算を行うことで、直接想起できなかったエンコード済み事実の40-65%を回復できることを実証
- モデルの知識を「エンコードされるか」と「知っているか」に区別し、ファクトレベル・プロファイリングという新しい評価手法を提案
LLMの知識エンコードと想起のギャップに着目した研究で、推論時間の計算増加により直接想起できない事実の40-65%を回復できるという知見は、モデル性能向上のアプローチとして外部データベースやモデルスケール拡大に依存しない新たな方向性を示すもの。評価手法の提案も含め、AIモデル開発の効率性と信頼性に影響を与える可能性があり、投資判断の材料として注目に値する。