Nunchaku 4ビット拡散推論をDiffusersに導入
Bringing Nunchaku 4-bit Diffusion Inference to Diffusers
Diffusersライブラリに、Nunchaku推論エンジンの基盤技術であるSVDQuantを用いた4ビット量子化モデルのネイティブサポートが追加されました。これにより、Nunchakuチェックポイントの読み込みが`from_pretrained()`メソッドで可能になり、ローカルでのCUDAコンパイルが不要になりました。Nunchaku Liteは、Transformerの主要レイヤーを4ビット重みと活性化(W4A4)で実行し、メモリ使用量を削減しつつデノイジングループを高速化します。NVFP4(NVIDIA Blackwell GPU向け)やINT4(Turing/Ampere/Ada世代GPU向け)のカーネルが利用可能です。例えば、RTX 5090では、BF16パイプラインで約24GBのメモリ使用量に対し、Nunchaku Lite NVFP4とbitsandbytes NF4テキストエンコーダーを組み合わせた場合、約1.7秒で1024x1024の画像を生成し、ピークメモリ使用量は約12GBに抑えられます。また、`diffuse-compressor`ツールキットにより、ユーザーは自身で新しいアーキテクチャを量子化し、Diffusersリポジトリとして公開できます。`torch.compile`との併用や、テキストエンコーダーの量子化、CPUオフロードなどの最適化も可能です。ベンチマークでは、BF16ベースラインと比較して、Nunchaku Lite NVFP4はピークVRAMを最大50%削減し、レイテンシを約30%改善しました。さらに、`torch.compile`を適用すると、速度が1.8倍に向上しました。
- Hugging Face DiffusersライブラリがNunchaku(SVDQuantベースの4ビット量子化)をネイティブサポート。from_pretrained()でチェックポイント読み込み可能に
- Nunchaku LiteはTransformer主要レイヤーを4ビット重みと活性化(W4A4)で実行し、メモリ削減と高速化を実現
- RTX 5090でBF16比、ピークVRAM最大50%削減、レイテンシ約30%改善。torch.compileで速度1.8倍向上
Hugging Face DiffusersへのNunchaku量子化推論のネイティブ統合は、GPUメモリ制約下での高解像度画像生成の実用性を大幅に高める。特にRTX 5090でピークVRAMを50%削減しつつレイテンシ30%改善という定量値は、ローカル実行やエッジAI需要の拡大を示唆しており、GPU販売促進・AI推論基盤の民主化の両面で市場インパクトが大きい。