Computer Anthology: AIエージェントのための継続的に進化するベンチマークファミリーの紹介
Computer Anthology: A continuously evolving benchmark family for AI agents
Computer Anthologyは、AIエージェントのベンチマークが直面する「飽和」と「静的な成果物」という2つの問題を解決するために開発された、継続的に進化するベンチマークファミリーです。従来のベンチマークが単一のスコアに集約されるのに対し、Computer Anthologyはターミナル操作、GUI操作、リバースエンジニアリング、プログラム合成、リポジトリ規模のエンジニアリングといった個別のコンピュータースキルを測定する複数のベンチマークで構成されます。これはデータセットというよりデータエンジンに近く、エージェント、独自モデル、人間、インフラストラクチャの生態系を基盤とし、ベンチマーク間で再利用され、モデルの進化と共に改善されます。最初のリリースであるTerminal Tasks v1.0は、100個の検証済みタスクから成り、フロンティアモデルでも60%以下の合格率となるよう調整されています。各タスクは、エージェントがターミナルから完了させるもので、公平性、決定論的な検証、人間によるレビューを経て作成されています。このベンチマークは、モデルの世代交代による進歩を測定するための固定された基準(ヤードスティック)として機能し、結果は公開フォーマット(Harborまたはcua)で提供されます。最初のリリースであるTerminal Tasks v1.0では、GPT-5.6 Solが58.0%の合格率を達成し、ベンチマークの有効性が示されています。また、ベンチマークの難易度はタスクによって異なり、デバッグが最も難しく、最適化、ソフトウェアエンジニアリング、データクエリが最も容易であることが示されています。タスクの構築においては、フロンティアモデルのパフォーマンスを基準に難易度を設定し、公平性を確保するために、タスクが実際に解けること、および検証プロセスが厳密であることを重視しています。
- Computer AnthologyがAIエージェント向けの継続的に進化するベンチマークファミリーとして発表され、初版Terminal Tasks v1.0は100個の検証済みタスクで構成される。
- GPT-5.6 SolがTerminal Tasks v1.0で58.0%の合格率を達成し、フロンティアモデルでも60%以下の合格率となるよう調整されている。
AIエージェント評価の基盤となる継続的ベンチマークの登場は、モデル性能の進歩を定量的に測る基準として投資判断に有用。GPT-5.6 Solが58.0%という具体的な合格率を示しており、フロンティアモデルの実力評価や企業間比較に活用できる。AIモデル開発企業の技術力評価に直接的に資する情報。