LiveCodeBenchリーダーボード発表:コードLLMの包括的かつ汚染フリーな評価
Introducing the LiveCodeBench Leaderboard - Holistic and Contamination-Free Evaluation of Code LLMs
LiveCodeBenchは、コーディングコンテストプラットフォームから収集した問題にリリース日を付与し、時間経過に伴うモデルの評価を可能にするベンチマークを導入しました。これにより、モデルの汚染(訓練データへの過学習)を検出し防止します。LiveCodeBenchは、コード生成だけでなく、自己修復、テスト出力予測、コード実行といった、次世代AIプログラミングエージェントに必要な能力を包括的に評価します。評価はLeetCode、AtCoder、CodeForcesの問題を使用し、Pass@1メトリックで実施されます。GPT-4 Turboは多くのシナリオで最高性能を示し、特に自己修復タスクで優位性を見せました。Claude-3 Opusはテスト出力予測シナリオでGPT-4 Turboを上回り、Mistral-Largeは自然言語推論タスクで健闘しました。LiveCodeBenchのコードとデータセットはGitHubで公開されており、共同研究者も募集しています。
- LiveCodeBenchがコードLLMの汚染フリー評価ベンチマークを発表
LiveCodeBenchはコード生成LLMの評価における「データ汚染」問題を解決する画期的なベンチマークであり、AIエージェントの真の進歩を測定する指標として投資判断上重要。GPT-4 Turboが自己修復タスクで優位、Claude-3 Opusがテスト出力予測で凌駕するなど、モデル間の能力差がシナリオ別に可視化された点は、AIスタートアップの技術選定や差別化要因を見極める上で示唆に富む。オープンソースで公開されたことで業界標準となる可能性が高く、ベンチマーク結果を活用する評価系スタートアップにも注目したい。