TRLにおけるビジョン言語モデルのアライメント強化:MPO、GRPO、GSPOなどの新手法導入
Vision Language Model Alignment in TRL ⚡️
TRL(Transformer Reinforcement Learning)ライブラリが、ビジョン言語モデル(VLM)のアライメントを強化するため、Mixed Preference Optimization (MPO)、Group Relative Policy Optimization (GRPO)、Group Sequence Policy Optimization (GSPO)といった新しい手法を導入しました。MPOは、DPO(Direct Preference Optimization)を拡張し、複数の損失関数(選好、品質、生成)を組み合わせることで、特にマルチモーダルモデルの性能向上を目指し、MathVistaで6.2ポイントの改善が見られました。GRPOは、PPO(Proximal Policy Optimization)をバッチ単位で更新することで報酬ノイズへの頑健性を高め、GSPOはGRPOのシーケンスレベルでの重要度サンプリングにより、より安定した学習を実現します。これらの新手法に加え、RLOO(Reinforce Leave One Out)やOnline DPOもVLMに対応し、SFT(Supervised Fine-Tuning)もVLMをネイティブにサポートするようになりました。また、vLLMとの統合により、オンラインアライメント手法の効率化も図られています。記事では、これらの手法の実装方法や、Qwen2.5VL-3Bモデルを用いた比較実験の結果も示されています。
- TRLライブラリがビジョン言語モデル向けにMPO、GRPO、GSPOの新手法を導入
- MPO手法によりMathVistaで6.2ポイントの性能改善を達成
- vLLMとの統合によりオンラインアライメント手法の効率化を実現
TRLライブラリがVLM向けにMPO, GRPO, GSPOといった最先端のアライメント手法を導入したことは、マルチモーダルAIモデルの性能向上と学習安定性に直結する。MathVistaで6.2ポイント改善という具体的な成果が示されており、VLMの精度向上は画像認識×言語理解を要する産業応用(ロボティクス、自動運転、医療画像診断等)の実用化を加速させる。vLLMとの統合によるオンライン手法の効率化も、研究開発コストの低減と実験サイクル高速化に寄与するため、AIスタートアップの技術優位性や大規模AI投資のリターンに影響を与えるポイントである。