A.I.AI
HANDBOOK.md: 長期コンテキストにおけるエージェントの指示追従性を評価するベンチマーク
Handbook.md shows that long policy documents do not reliably govern agents
YHacker News
AIが原文を翻訳・要約しています
スタンフォード大学の研究者らは、長文の指示文書(ハンドブック)が言語モデルエージェントの行動をどの程度正確に制御できるかを評価するベンチマーク「HANDBOOK.md」を開発した。このベンチマークは、65のエージェントタスクで構成され、各タスクは20〜124ページのマニュアルに基づいて、企業環境(財務、医療、保険、物流、人事)における日常業務をエージェントに実行させる。評価は、824のプログラム基準に基づき、厳格な採点では最良のモデルでも36.2%しか合格しなかった。エージェントは、環境からの要求によってポリシーを無視したり、ルール詳細を忘れたり、コンプライアンスを達成できなかったりする傾向が見られた。この研究は、長文の指示文書に依存するエージェントシステムの信頼性に関する課題を浮き彫りにしている。
KEY POINTS要点記事から抽出した重要情報
- スタンフォード大学がLLMエージェントの長文指示追従性を評価するベンチマーク「HANDBOOK.md」を発表
- 65のエージェントタスクで構成、824のプログラム基準による厳格な採点で最良モデルでも36.2%しか合格せず
- エージェントは環境要求によりポリシーを無視する傾向が確認され、長文指示に依存するシステムの信頼性課題が浮き彫りに
CONTEXT文脈編集部による背景整理
AIエージェントが長文の指示文書に従って業務を遂行できるかどうかは、エンタープライズ向けAI導入の鍵を握る。本ベンチマークは、最良モデルでも合格率36.2%と極めて低く、現状のLLMでは現実の企業業務を委任するには信頼性が不十分であることを定量的に示した。これはAIエージェントの実用化フェーズにおける重大なギャップを露呈しており、指示追従性能の改善が企業向けAIソリューションの競争優位性を左右する領域となりうる。
原文を読むAnalyzed at 2026年7月30日 00:00