Arbor:AIの自律最適化を試行錯誤から累積学習プロセスへ進化させる新フレームワーク
New AI optimization framework beats Claude Code and Codex by 2.5x on the same compute budget
Renmin大学とMicrosoft Researchの研究者たちは、AIの自律最適化(AO)における試行錯誤のプロセスを累積学習プロセスへと進化させるフレームワーク「Arbor」を発表しました。Arborは、仮説、実験、洞察をツリー構造で整理し、過去の失敗から学習して検証された改善を可能にします。実世界のエンジニアリングタスクにおいて、Arborは従来のAIコーディングエージェントと比較して、同じ計算予算内で2.5倍以上の検証可能なパフォーマンス向上を達成しました。Arborは、長期的な研究の方向性を管理する「コーディネーター」と、個別の仮説を実行する「エグゼキューター」の2つのコンポーネントで構成され、これらが「Hypothesis Tree Refinement(HTR)」というメカニズムを通じて連携します。HTRは、仮説、実行可能成果物、生成された証拠、そして洞察をノードに結びつけ、複数の競合する方向性を同時に探索することを可能にします。これにより、失敗の原因を記録し、同じ間違いを繰り返すことを防ぎます。また、開発データへの過学習や報酬ハッキングを防ぐため、厳格な「マージゲート」を設けており、検証された改善のみが採用されます。Arborは、パイプライン最適化、データ合成品質、モデルトレーニングレシピ調整などのタスクに適していますが、リアルタイム性が求められるタスクや評価指標が不正確な場合には推奨されません。主なコストはトークン費用と計算リソースですが、既存のGitワークフロー上に構築できるため、導入が容易です。
- 中国人民大学とMicrosoft Researchが、AI自律最適化フレームワーク「Arbor」を発表した
- Arborは実世界のエンジニアリングタスクにおいて、従来のAIコーディングエージェントと比較して同じ計算予算内で2.5倍以上の検証可能なパフォーマンス向上を達成した
本記事の注目点は、Microsoft Researchが中国人民大学と共同で開発したArborが、AIエージェントの自律最適化を従来の試行錯誤から累積学習へと進化させ、実タスクで2.5倍以上の性能向上を実証したことだ。AIエージェントの自己改善能力は、ソフトウェア開発効率を劇的に変える可能性があり、MicrosoftのAIサービスやGitHub Copilotなどの競争力強化に直結する。研究段階ではあるが、実用的な成果が出始めている点で注視に値する。