VQ-Diffusion: コード数行で実行可能な画像生成モデル
VQ-Diffusion
Diffusersライブラリを使用すると、わずか数行のコードでVQ-Diffusionモデルを実行できます。VQ-Diffusionは、画像を離散的な「トークン」または埋め込みベクトルにエンコードするためにVQ-VAEエンコーダーを使用し、Taming TransformersのVQGANバリアントを採用しています。拡散プロセスでは、潜在トークンはそのまま維持されるか、別の潜在ベクトルにリサンプリングされるか、マスクされます。エンコーダー-デコーダー変換器が、CLIPテキストエンコーダーを条件として、ノイズのない潜在クラスを近似します。従来の連続拡散モデルとは異なり、離散拡散モデルはノイズを予測するのではなく、ノイズのない分布を直接予測します。VQ-Diffusionは、自己回帰(AR)モデルと比較して、推論速度の線形低下、エラーの蓄積、方向バイアスの問題を改善し、同等サイズのARトランスフォーマーモデルよりも高速で高品質な画像生成を実現します。ITHQデータセット以外にも、CUB-200、Oxford-102、MSCOCO、Conceptual Captions、LAION-400M、ImageNetで学習されたモデルも利用可能です。
- VQ-DiffusionモデルがDiffusersライブラリでコード数行で実行可能に公開された
VQ-Diffusionは離散拡散モデルを用いた画像生成手法であり、従来の自己回帰モデルと比較して推論速度が速く、高品質な画像生成を実現する点が注目に値する。Diffusersライブラリで数行のコードから実行可能であり、実用性・再現性が高い。画像生成AI分野の技術進化は競争を激化させており、このような効率的なモデルの登場は、AIスタートアップやクラウドプラットフォームのサービス差別化要因となりうる。