Metaの研究者、高価な最先端モデルなしでClaude Opus 4.5に匹敵する8B AIモデルを開発
Meta researchers taught an 8B AI model to match Claude Opus 4.5 — without the frontier price tag
Meta AIとイリノイ大学アーバナ・シャンペーン校の研究者らは、AIエージェントが複雑な長期間タスクを遂行する際の効率と自律性を向上させるフレームワーク「EvoHarness-RL」を発表した。EvoHarness-RLは、AIエージェントの実行環境(ハーネス)に抽象化レイヤーを追加し、環境から得た情報をいつ読み取り、更新し、統合するかを学習させる。このフレームワークは、エージェントの外部状態管理を「Belief(信念)」「Progress(進捗)」「Experience(経験)」の3つの機能領域に統合した統一インターフェース「BPE」を通じて行う。これにより、エージェントは「track」「commit」「recall」「note」の4つのメタアクションで対話する。EvoHarness-RLは、2段階のトレーニングプロセス(教師ありハーネスファインチューニングとコスト意識型強化学習)を経て、エージェントに外部状態へのアクセス効率を学習させる。Qwen3-8BモデルにEvoHarness-RLを適用した結果、ALFWorldベンチマークで96.9%の成功率を達成し、Claude Opus 4.5(96.4%)に匹敵する性能を示した。また、GPT-4.1やGPT-5といった最先端モデルでも、BPEハーネスを導入することで性能が大幅に向上した。この技術は、AIエージェントの「ハーネスの焼きなまし」と「ハーネスの進化」という現象を通じて、推論コストの削減と動的な戦略適応を可能にする。
- Meta AIとイリノイ大学アーバナ・シャンペーン校の研究者が、AIエージェントの外部状態管理を効率化するフレームワーク「EvoHarness-RL」を発表した。
- Qwen3-8BモデルにEvoHarness-RLを適用した結果、ALFWorldベンチマークで96.9%の成功率を達成し、Claude Opus 4.5(96.4%)に匹敵する性能を示した。
- GPT-4.1やGPT-5といった最先端モデルでも、BPEハーネスの導入により性能が大幅に向上した。
Metaの研究者が発表したEvoHarness-RLは、8B規模の小型モデルが最先端の超大規模モデル(Claude Opus 4.5)に匹敵するエージェント性能を達成できることを示しており、AIエージェント領域における推論コスト削減の可能性を大きく前進させる。モデル規模と性能のトレードオフを覆すこの成果は、エッジAIやコスト効率重視の導入企業にとって強力な選択肢となりうる。さらに、既存の大型モデル(GPT-4.1/GPT-5)にもBPEハーネスを適用することで性能が向上する点は、モデル非依存の技術としての展開余地が大きく、研究開発投資の方向性として注視に値する。