DiffusersがFLUX.2を発表:画像生成・編集モデルの進化
Diffusers welcomes FLUX-2
Hugging FaceのDiffusersライブラリが、新しい画像生成・編集モデル「FLUX.2」を発表しました。FLUX.2はFLUX.1の後継モデルですが、直接的な置き換えではなく、画像ガイドおよびテキストガイドによる画像生成、複数画像の参照入力に対応しています。主な変更点として、テキストエンコーダーがMistral Small 3.1の単一エンコーダーに変更され、プロンプト埋め込みの計算が簡略化されました。アーキテクチャはMM-DiT + parallel DiTを踏襲しつつ、時間情報とガイダンス情報が全ブロックで共有されるようになりました。また、バイアスパラメータを使用しない、Attention QKVプロジェクションとFF入力プロジェクションを融合した完全並列Transformerブロックの採用、単一ストリームブロックの比率増加(8/48 vs 19/38)などが挙げられます。さらに、新しいAutoencoderKLFlux2と、解像度に依存したタイムステップスケジュールの改善も含まれます。FLUX.2はより大きなDiTとMistral3 Smallテキストエンコーダーを使用しており、推論には80GB以上のVRAMが必要ですが、CPUオフロード、Flash Attention 3、4ビット量子化(bitsandbytes)、グループオフロード、リモートテキストエンコーダーなどの最適化により、より少ないVRAM(24GB、18GB、8GB)でも利用可能になっています。また、複数画像入力(最大10枚)や、構造化JSONプロンプティング、正確な16進数カラー制御、マルチリファレンス画像編集といった高度なプロンプティング機能もサポートしています。LoRAファインチューニングも可能で、推論最適化技術をトレーニングにも応用することで、メモリ消費量を削減しています。トレーニング時には、リモートテキストエンコーダー、CPUオフロード、ラテントキャッシュ、QLoRA(NF4/FP8)、勾配チェックポインティングと蓄積、8ビットAdamオプティマイザーなどの手法が利用可能です。
- Hugging FaceのDiffusersライブラリが画像生成・編集モデル「FLUX.2」を発表
Hugging Face社が主力のDiffusersライブラリでFLUX.2モデルをリリースした点が重要。FLUX.2はテキストエンコーダにMistral Small 3.1を採用し、アーキテクチャ面で完全並列Transformerブロックや単一ストリームブロック比率の増加といった独自の改良を加えており、単なるマイナーアップデートではない。特に注目すべきは、24GB・18GB・8GBといったコンシューマー級GPUでも推論可能な最適化技術(CPUオフロード、Flash Attention 3、4ビット量子化など)を標準提供している点で、画像生成AIのデプロイハードルを大幅に引き下げる可能性がある。また、マルチリファレンス画像編集や構造化JSONプロンプティング、正確な16進数カラー制御といった高度な機能を備え、LoRAファインチューニングにも対応。推論最適化技術をトレーニングに応用しメモリ消費を削減するアプローチは、エッジや個人環境でのモデルカスタマイズ普及に寄与する。投資家としては、Hugging Faceのエコシステム強化によるMaaS(Model as a Service)領域での競争力向上と、同社周辺のツールチェーン・インフラ企業への波及効果に注目したい。