Open R1: コード推論能力向上に向けたデータセット、ベンチマーク、モデルの公開
Open R1: Update #3
Hugging Faceは、コード推論能力の向上を目指し、新たなデータセット「CodeForces-CoTs」、ベンチマーク「IOI benchmark」、およびファインチューニングされたモデル「OlympicCoder」を公開した。CodeForces-CoTsは、C++とPythonで約10万件の高品質なサンプルを含む。IOI benchmarkは、国際情報オリンピック(IOI)の難易度の高い問題で構成されている。OlympicCoderは、7Bと32Bのモデルがあり、IOIの問題においてClaude 3.7 Sonnetのようなクローズドソースモデルを上回る性能を示した。特にOlympicCoder-32Bは、自身が基盤としたDeepSeek-R1モデルよりも優れた性能を発揮した。また、記事では、データセット構築、モデルのファインチューニングにおけるサンプリングパッキングの影響、学習率の効果、およびGRPO(Generation Reuse Policy Optimization)の改善点についても詳述している。さらに、OpenR1-Math-Rawデータセットにメタデータを追加し、検証によるフィルタリングがモデルの初期性能に与える影響についても分析している。
- Hugging Faceがコード推論能力向上のためのデータセット「CodeForces-CoTs」、ベンチマーク「IOI benchmark」、モデル「OlympicCoder」を公開
- OlympicCoder-32Bが国際情報オリンピックの問題においてClaude 3.7 SonnetやDeepSeek-R1を上回る性能を達成
Hugging Faceが公開したCodeForces-CoTsデータセット、IOIベンチマーク、OlympicCoderモデルは、コード推論分野におけるオープンソースモデルの性能向上を示す重要な成果。特にOlympicCoder-32Bが、基盤としたDeepSeek-R1を上回り、かつClaude 3.7 Sonnetのようなクローズドソースモデルに競合する性能を示した点は、オープンソースAIエコシステムの価値向上と、Hugging Faceのプラットフォーム価値強化に寄与する。コード推論はAIエージェントの基盤能力であり、この分野でのブレークスルーは広範なAIユースケースに波及するため、投資家はHugging Faceのエコシステム戦略とオープンモデルの品質向上トレンドに注目すべき。