GPT-OSSの強化学習(RL)トレーニングを可能にするための実践的なレトロスペクティブ
Unlocking Agentic RL Training for GPT-OSS: A Practical Retrospective
この記事は、LinkedInが開発したGPT-OSSモデルを、エージェント型強化学習(RL)トレーニングに活用するための技術的な課題と解決策について詳述しています。主な課題として、Mixture of Experts(MoE)アーキテクチャにおける非決定的なルーティングによるPPOの安定性問題、FlashAttention v2/v3におけるアテンションシンクのサポート不足、そしてFSDP(Fully Sharded Data Parallelism)環境下での過剰なメモリ消費が挙げられています。これらの問題に対し、ログ確率の置換によるオンポリシー学習の整合性回復、アテンションシンクのバックワードパスの実装とFlashAttention v3への統合、MoEフォワードパスのパッチ適用とシーケンス並列化の導入によるメモリ効率の改善といった解決策が提案・実施されました。これらの改善により、GPT-OSSモデルは、数学的推論(GSM8K)、指示追従(VerifyIf)、ツールの使用を伴うマルチターンエージェントRL(ReTool)などのタスクにおいて、安定した学習と性能向上を示し、エージェント型アプリケーションのバックボーンモデルとしての可能性が検証されました。
- LinkedInがGPT-OSSモデルに対してエージェント型強化学習(RL)トレーニングを実現するための技術的課題を解決し、実装を公開
LinkedInがGPT-OSSモデルにRLトレーニングを適用し、MoEアーキテクチャの非決定的ルーティングやFlashAttentionのアテンションシンク問題など実運用上の課題を解決した点は、エージェント型AIの実用化に向けた重要な進展。特に、数学的推論(GSM8K)やマルチターンエージェントRL(ReTool)での性能検証は、企業向けAIエージェント市場の拡大を示唆しており、大規模言語モデルのエンタープライズ応用を手掛ける企業や、RLトレーニングフレームワークを提供するスタートアップへの投資機会につながる。