GPT-5.5が新ベンチマーク「Agents' Last Exam」でClaude Fable 5を上回る
Surprise upset: GPT-5.5 beats Claude Fable 5 on brutal new Agents’ Last Exam benchmark
カリフォルニア大学バークレー校の研究者らが、AIが経済的に価値のある長期的な専門的ワークフローを実行できるかを測定する新しいベンチマーク「Agents' Last Exam (ALE)」を発表した。OpenAIのGPT-5.5は、Codexハーネスを通じて動作し、24.0%の合格率でトップを獲得した。これは、前日にリリースされたAnthropicのClaude Fable 5モデル(合格率22.0%で3位)を上回る結果となった。ALEは、従来のベンチマークとは異なり、5つの機能レイヤー(Brain, Eyes, Body, Hands, Feet)を持つGeneralist Computer-Use Agent (GCUA) フレームワークを採用し、実際の業務に近い評価を行う。評価は、GPT-5.5が優位性を示したが、最も難しい「Last-Exam」ティアでは、多くのモデルが0.0%の合格率となった。ALEは、評価データの約10%のみを公開し、残りは非公開とすることで、ベンチマーク汚染を防ぐ「リビングベンチマーク」として機能する。
- カリフォルニア大学バークレー校の研究者らが、AIの長期的専門的ワークフロー実行能力を測定する新ベンチマーク「Agents' Last Exam (ALE)」を発表した
- OpenAIのGPT-5.5がCodexハーネスを通じてALEで24.0%の合格率でトップを獲得した
- AnthropicのClaude Fable 5は合格率22.0%で3位となり、GPT-5.5がこれを上回った
新しいAIエージェントベンチマーク「Agents' Last Exam (ALE)」の登場は、AIモデルの評価が従来の知識クイズ型から実業務遂行能力へと軸足を移していることを示す。GPT-5.5がClaude Fable 5を上回ったという結果は、OpenAIとAnthropicの競争が一段と激化している証左であり、両社のモデル性能差が投資判断に直結する。特にALEはリビングベンチマークとして汚染耐性を持ち、長期的な評価基準となる可能性が高いため、このベンチマークでの各社の推移は注視すべき。