QuantoとDiffusersライブラリを活用したメモリ効率の良い拡散Transformer
Memory-efficient Diffusion Transformers with Quanto and Diffusers
この記事では、Quantoの量子化ユーティリティとDiffusersライブラリを利用して、Transformerベースの拡散パイプラインのメモリ効率を向上させる方法を解説しています。Stable Diffusion 3のような大規模モデルは、FP16精度で推論を実行するのに18.765GBのGPUメモリを必要としますが、Quantoを使用することで、特にFP8やINT8への量子化により、メモリ使用量を大幅に削減できます。例えば、PixArtモデルでは、FP8量子化とテキストエンコーダーの量子化を組み合わせることで、メモリ使用量を16.403GBから8.200GBまで削減できることが示されています。また、INT8量子化とQKVプロジェクションの水平融合を組み合わせることで、推論レイテンシを短縮することも可能です。さらに、量子化されたモデルは保存・ロードが可能であり、チェックポイントサイズも大幅に縮小されます。ただし、INT4量子化のようなより積極的な量子化は、品質の低下を招く可能性があるため、最終層の除外などの工夫が必要になる場合があります。
- QuantoとDiffusersライブラリを用いて拡散Transformerモデルのメモリ使用量を削減する手法が公開された
本記事は、QuantoとDiffusersライブラリを用いた拡散Transformerのメモリ効率改善手法を解説している。Stable Diffusion 3のような大規模画像生成モデルの推論には18GB超のGPUメモリが必要だが、FP8/INT8量子化によって半減可能であり、これはエッジデバイスやバジェット制約のある環境での展開可能性を大きく広げる。特にPixArtモデルで16.4GB→8.2GBへの削減が示された点は、クラウドGPUコスト削減やオンプレ運用への示唆があり、AI推論の民主化・低コスト化トレンドを加速する技術的ブレークスルーとして注目に値する。ただしINT4量子化では品質劣化リスクがあるため、精度とメモリのトレードオフを注視する必要がある。