LoRAアダプターをvLLMに非同期で同期する新手法:HF Jobs、バケット、プロキシを活用
Async GRPO with LoRA across HF Jobs: a bucket, a proxy, and no NCCL
TRL v1.14で導入されたAsyncGRPOTrainerは、LoRAアダプターのみをvLLMに同期できるようになり、トレーニングと推論を別々のHugging Face Jobsで実行可能になった。この新手法では、数メガバイトのランク1アダプターをストレージバケット経由で転送するため、NCCLのようなネットワーク帯域を消費しない。各vLLMレプリカの前段に配置されたプロキシは、認証ヘッダーの追加、KVキャッシュのヒット率を高めるルーティング、アダプターロードのブロードキャストを行う。これにより、500ステップの学習時間が3時間27分から53分に短縮されるなど、大幅な効率化が実現した。プロキシは、アダプター名とブロックハッシュに基づいてリクエストを適切なレプリカにルーティングし、KVキャッシュの再利用を最大化する。このシステムは、Hugging Face Jobsのストレージバケットをマウントして共有ファイルシステムとして利用し、トレーニングと推論の分離を容易にする。
- TRL v1.14のAsyncGRPOTrainerにより、LoRAアダプターのみをvLLMに同期し、学習と推論を別々のHugging Face Jobsで実行可能になった
- 数メガバイトのランク1アダプターをストレージバケット経由で転送するため、NCCLのようなネットワーク帯域を消費しない
- 各vLLMレプリカの前段のプロキシが認証ヘッダー追加、KVキャッシュのヒット率を高めるルーティング、アダプターロードのブロードキャストを担う
- 500ステップの学習時間が3時間27分から53分に短縮されるなど大幅な効率化を実現
- アダプター名とブロックハッシュに基づくリクエストのレプリカ振り分けでKVキャッシュの再利用を最大化する
- Hugging Face Jobsのストレージバケットをマウントし共有ファイルシステムとして利用することで、トレーニングと推論の分離を容易にする
LLMの強化学習(GRPO)と推論サービングを分離し、LoRAアダプターだけをバケット経由で非同期同期する仕組みは、GPUクラスタの帯域コストと学習時間を同時に削る現実的な効率化策。500ステップが3時間27分→53分という短縮は、ポストトレーニングの反復速度がそのままモデル改善サイクルと計算コスト競争力に効くことを示す。バケット・プロキシ・KVCacheルーティングを組み合わせた部分は、推論インフラ側のソフトウェア資産価値が高まる論点であり、LLM運用基盤やオーケストレーションツールを手掛ける企業の相対優位を測る材料になる。