DiffusionGemma技術レポート
DiffusionGemma Technical Report
DiffusionGemmaは、離散拡散モデルを用いて高速なテキスト生成を実現する実験的なオープンウェイト言語モデルである。従来の自己回帰型モデルがトークンを一つずつ生成するのに対し、DiffusionGemmaは256トークンのブロックを並列的に反復処理することで、生成速度のボトルネックを解消する。Gemma 4モデル(アクティブパラメータ3.8B、総パラメータ25.2B)をファインチューニングして開発され、2段階の学習パイプラインにより、元のモデルの学習トークン予算の10%未満で済む。第1段階では双方向デノイジングを学習し、第2段階では強化学習とサンプラー蒸留を組み合わせて生成品質と推論効率を向上させる。DiffusionGemmaは、生成速度とモデル能力のトレードオフにおいて新たなパレートフロンティアを確立し、NVIDIA H100 GPU 1基あたり約1,500トークン/秒の生成速度を達成する。これは最先端の投機的デコーディングを用いた自己回帰型モデルよりも大幅に高速である。また、元のモデルの思考モード、マルチモーダル入力、長文コンテキストのサポートも維持しており、わずかな性能低下で自己回帰型生成も可能である。
- DiffusionGemmaは離散拡散モデルを用いた実験的なオープンウェイト言語モデルで、256トークンのブロックを並列的に処理することで従来の自己回帰モデルの生成速度ボトルネックを解消する
- Gemma 4モデル(アクティブパラメータ3.8B、総パラメータ25.2B)をファインチューニングして開発され、元のモデルの学習トークン予算の10%未満で学習が完了する
- NVIDIA H100 GPU 1基あたり約1,500トークン/秒の生成速度を達成し、最先端の投機的デコーディングを用いた自己回帰型モデルより大幅に高速
- 思考モード、マルチモーダル入力、長文コンテキストのサポートを維持しつつ、わずかな性能低下で自己回帰型生成も可能
DiffusionGemmaは、拡散モデルによる並列トークン生成で推論速度を飛躍的に向上させる技術であり、LLM推論コスト削減とリアルタイム生成の実現可能性を示す点で投資価値が高い。H100 1基あたり約1,500トークン/秒という生成速度は、既存の自己回帰モデルと比較して大きなアドバンテージであり、推論基盤の効率化が求められる生成AI市場において注目すべき技術トレンドである。