Deepseek R1の「aha moment」をRLチュートリアルで再現するMini-R1
Mini-R1: Reproduce Deepseek R1 „aha moment“ a RL tutorial
Deepseek R1は、OpenAIのo1に匹敵する複雑な推論能力を持つオープンモデルとして業界に衝撃を与えた。このモデルは、Group Relative Policy Optimization (GRPO)と多段階のRL(強化学習)トレーニングアプローチを用いて開発された。本記事では、GRPOと数当てゲーム(Countdown Game)を用いて、Deepseek-R1の「aha moment」と呼ばれる、モデルが自己検証と探索能力を自律的に学習する現象を再現する試みを紹介する。この再現実験は、DeepspeedとvLLMを用いた分散学習に焦点を当て、4基のNVIDIA H100 GPUで実行された。GRPOは、従来のPPOアルゴリズムを改良し、価値関数モデルを不要にし、グループスコアからベースラインを推定することでメモリ使用量と計算オーバーヘッドを削減する。実験では、Qwen/Qwen2.5-3B-InstructモデルとJiayi-Pan/Countdown-Tasks-3to4データセットを使用し、フォーマット報酬と精度報酬の2つの報酬関数を定義した。分散学習により、1ステップあたり約45-60秒で完了し、450ステップの全トレーニングには約6時間かかった。トレーニングの進捗に伴い、モデルは正しいフォーマットを学習し、方程式を解く成功率が向上し、最終的に約50%の成功率に達した。筆者は、モデルのパフォーマンス向上の理由として、ベースモデルの能力、報酬関数の定義、またはトレーニング時間の不足などを考察している。
- Deepseek R1の強化学習手法(GRPO)を再現するMini-R1プロジェクトが公開され、H100 4基で6時間のトレーニングにより小規模モデルでも「aha moment」が再現可能であることが示された
本記事はDeepseek R1の強化学習手法(GRPO)をオープンソースで再現・チュートリアル化した試みを報告している。投資家視点では、Deepseek R1が示した「自己検証・探索能力の自律的獲得(aha moment)」を小規模モデルでも再現可能であることを実証した点が重要。OpenAI o1級の推論能力を持つモデルが、大規模な報酬モデルを必要としないGRPOによって低コスト(H100×4台で6時間)で訓練できる可能性を示唆しており、AIモデル開発の民主化・低コスト化トレンドを裏付ける。このような再現性の高いチュートリアルが公開されることで、推論特化型AIの普及が加速し、GPU需要(Inference向け)やAIエージェント応用市場に波及効果をもたらす可能性がある。