SlopCodeBenchにおけるOpus 5のベンチマーク評価
Benchmarking Opus 5 on SlopCodeBench
本記事は、新しい長期間コーディングベンチマークであるSlopCodeBenchを用いたClaude Opus 5の性能評価について詳述している。SlopCodeBenchは、問題全体を一度に提示するのではなく、複数の「チェックポイント」を通じて段階的に要件を開示する点が特徴であり、実際のソフトウェア開発に近い状況を模倣している。著者による小規模なサブセットでのテストでは、Opus 5は24%の厳密合格率を達成したが、これは先行モデルであるOpus 4.6の17%から大きくは向上しなかった。テストされた全モデルは、チャレンジが進むにつれて冗長性や複雑性が増加する傾向が見られ、Opus 5はOpus 4.8と比較して5倍の関数を生成した。著者は、現在のモデルが段階的にコードベースを構築する実際のソフトウェアエンジニアリング作業において、まだ自律的に信頼できるレベルには達していないと結論付けている。記事では、コード品質指標(サイズ、複雑性、重複、分解、ルール違反、依存関係グラフなど)についても詳細に分析されており、これらの指標がモデルの性能を評価する上で有用である可能性が示唆されている。特に、モデルが生成するコードの保守性や進化のしやすさを測る指標としてSlopCodeBenchの有効性が強調されている。
- Claude Opus 5がSlopCodeBenchで24%の厳密合格率を達成
- Opus 5のスコアは先行モデルOpus 4.6の17%から大きく向上せず
- Opus 5はOpus 4.8と比較して5倍の関数を生成し、冗長性・複雑性が増加
本記事は、最新のClaude Opus 5が新しいコードベンチマークSlopCodeBenchで、先行モデルから大きく性能向上していないことを示している。コーディングAIの進化が頭打ちになりつつある可能性を示唆するデータであり、AI企業の技術的優位性や製品差別化を評価する上で、ベンチマークスコア以上に実タスクでの性能やコード品質指標が重要であることを再認識させる。特にOpus 5がOpus 4.8比で5倍の関数を生成するという結果は、モデル規模拡大による悪影響(冗長性・複雑性の増大)を示しており、スケーリング則への疑問を投資家に投げかける。