FrontierCode:高品質な本番コード作成能力を測る新しいベンチマーク
FrontierCode
Cognitionは、AIモデルが高品質な本番コードを作成する能力を測定する新しいベンチマーク「FrontierCode」を発表した。このベンチマークは、コードの「マージ可能性」を評価する初の試みであり、正確性だけでなく、テストの質、コードのスコープ、スタイル、リポジトリの標準への準拠といったエンドツーエンドのコード品質を評価する。20名以上の著名なオープンソースメンテナーが、自身が管理するリポジトリから現実的で挑戦的なコーディングタスクを作成し、各タスクに40時間以上を費やした。評価には、単体テスト、ルーブリック、新しいタイプの検証ツールなど、複数の評価手法が組み合わされている。FrontierCodeは、従来のベンチマークと比較して誤分類エラー率を81%削減し、より正確なモデル評価を実現する。最先端のモデルでもFrontierCode Diamond(最も難易度の高いサブセット)ではClaude Opus 4.8が13.4%のスコアに留まるなど、依然として高いハードルであることが示された。また、GPT-5.5はOpus 4.8よりもトークン使用量が少なく、コスト効率の良い選択肢となる可能性も示唆されている。FrontierCodeは、Extended(150タスク)、Main(100タスク)、Diamond(50タスク)の3つの難易度サブセットで構成され、パス率とスコアの2つの指標で評価される。このベンチマークは、次世代のコーディングエージェントの評価基準となることが期待される。
- CognitionがAIモデルの本番コード品質を測定する新しいベンチマーク「FrontierCode」を発表した
- FrontierCode Diamond(最高難易度サブセット)でClaude Opus 4.8が13.4%のスコアに留まった
- GPT-5.5はOpus 4.8よりトークン使用量が少なくコスト効率が良い可能性が示唆された
Cognitionが発表したFrontierCodeは、コードの「マージ可能性」を評価する初のベンチマークであり、AIモデルの本番コード品質を実用的な観点から測定する点で画期的。Claude Opus 4.8でもDiamondサブセットで13.4%と低スコアであり、今後のAIコーディングエージェントの性能向上余地が極めて大きいことを示す。また、GPT-5.5のコスト効率の良さが示唆されるなど、モデル間の競争構図や開発企業の投資判断に直結する情報を含む。