Open-R1 プロジェクトの進捗報告と DeepSeek-R1 に関するコミュニティの動向
Open-R1: Update #1
Open-R1 プロジェクトは、DeepSeek-R1 のトレーニングパイプラインと合成データセットの再現を目指し、開始から1週間でMATH-500ベンチマークにおいてDeepSeek-R1の結果を再現することに成功した。DeepSeek-R1の生成する応答は平均6,000トークンと非常に長く、評価やGPROトレーニングに課題があることが示唆されている。コミュニティでは、GRPO(Grouped Relative Policy Optimization)がTRLライブラリに統合され、DeepSpeed ZeROやvLLMと連携して効率的なトレーニングが可能になった。また、DeepSeek-R1のモデルサイズと生成効率に関する課題に対し、8xH100ノード2つから32GPU(4x 8xH100ノード)構成への移行や、バッチ処理からストリーミング処理への変更により、スループットとGPU利用率が改善された。メディアではCNN、Bloomberg、NPRなどで取り上げられ、Sam Altman氏やDario Amodei氏などAI業界の著名人も言及している。Dell、AWSなどのプラットフォームでもDeepSeek-R1が利用可能になった。トレーニングコストに関する推測も行われており、Tom Goldstein氏やSemiAnalysisなどが分析している。コミュニティでは、GRPOトレーナーを用いた小規模モデルでの再現、TinyZeroによる低コストでの体験、Mini-R1のチュートリアル、HKUSTによる推論能力の出現、Evolving LLM labによるマルチモーダル版、Stepanov氏による情報抽出への応用など、多様なプロジェクトが進行中である。また、Bespoke-Stratos-17k、OpenThoughts-114k、cognitivecomputations/dolphin-r1、ServiceNow-AI/R1-Distill-SFT、NovaSky-AI/Sky-T1_data_17k、Magpie-Align/Magpie-Reasoning-V2-250K-CoT-Deepseek-R1-Llama-70Bといった、推論や問題解決に焦点を当てたデータセットも多数公開されている。Open-R1プロジェクトは、トレーニングパイプラインの完成と高品質データセットの生成を目指しており、GitHubやHugging Faceでの貢献を呼びかけている。
- Open-R1プロジェクトが開始1週間でMATH-500ベンチマークにおいてDeepSeek-R1の結果を再現することに成功した
- GRPO (Grouped Relative Policy Optimization) がTRLライブラリに統合され、DeepSpeed ZeROやvLLMと連携した効率的なトレーニングが可能になった
- DeepSeek-R1がDell、AWSなどのプラットフォームで利用可能になった
DeepSeek-R1のオープンソース再現プロジェクト「Open-R1」が開始1週間でMATH-500ベンチマークの再現に成功した点は、AIモデルの透明性とコミュニティ主導の研究開発が加速していることを示す。GRPOのTRL統合、分散GPU構成の最適化など、低コストで高性能な推論モデルの訓練手法が急速に成熟しており、クラウドAIインフラ需要やAIモデル市場の競争構造に影響を与えうる。投資家は、オープンソースAIのエコシステム拡大がクローズドモデルの優位性を脅かす動きを注視すべきである。