Hugging Face、TRLでモデルの重み同期を効率化するDelta Weight Syncを発表
Shipping a Trillion Parameters With a Hub Bucket: Delta Weight Sync in TRL
Hugging Faceは、非同期強化学習(Async RL)におけるモデルの重み同期の課題を解決する「Delta Weight Sync」をTRL(Transformer Reinforcement Learning)ライブラリに導入しました。従来の重み同期では、モデル全体(例: 1兆パラメータモデルで約1TB)をステップごとに転送する必要がありましたが、Delta Weight Syncでは、連続する学習ステップ間で変化した重みのみを抽出してsparse safetensorsファイルとしてアップロードします。これにより、転送データ量を約99%削減し、Qwen3-0.6Bモデルでは1.2GBから20-35MBに削減されました。この技術は、学習器、推論エンジン、環境を別々の場所に配置し、Hugging Face Bucketを介して重みデータをやり取りする分散学習アーキテクチャを可能にします。これにより、クラスターやRDMAネットワークが不要になり、Async RLのコストが大幅に削減されます。bf16形式の重みの約99%が変更されないという算術的特性を利用しており、変化した重みのみを効率的に転送することで、推論の停止時間を短縮し、学習プロセス全体の効率を向上させます。
- Hugging FaceがTRLライブラリにDelta Weight Syncを導入した
Hugging Faceが発表したDelta Weight Syncは、Async RLにおける重み同期の通信コストを約99%削減する技術であり、分散強化学習の経済性を劇的に改善する。大規模モデルの学習において、RDMAや専用クラスターが不要になることで、より多くのスタートアップや研究機関が大規模Async RLに参入可能になり、AI学習インフラ全体のコスト構造を変える可能性がある。学習効率向上に直結する基盤的技術であり、Hugging Faceのエコシステム強化という観点でも注目すべき発表である。