Google、自己修正機能を備えた並列256トークン生成モデル「DiffusionGemma」を発表
Google's DiffusionGemma generates 256 tokens in parallel and self-corrects as it goes
Googleは、テキスト生成に拡散モデル技術を応用したオープンソースの実験的モデル「DiffusionGemma」を発表した。これは、従来の逐次的なトークン生成とは異なり、256トークンを並列で生成し、自己修正機能を持つ。これにより、特にローカル推論や低並列度環境において、標準モデルと比較して最大4倍高速な生成が可能になる。Nvidia H100 GPUではFP8版で毎秒1,008トークン、H200では毎秒1,288トークンを達成した。ただし、全体的な出力品質は標準のGemma 4モデルより低いとされており、最高品質が求められる場合は標準モデルが推奨される。DiffusionGemmaは、Sudokuソルバーの例で示されたように、制約のあるタスクや双方向の文脈理解が必要な場合に構造的な利点を持つ。このモデルは26BのMixture of Expertsモデルとして構築され、推論時には3.8Bパラメータのみをアクティブ化する。また、オープンソースのvLLM推論プラットフォームでネイティブにサポートされる初の拡散言語モデルである。
- Googleが拡散モデル技術を応用したテキスト生成モデル「DiffusionGemma」を発表・公開した
- 256トークンを並列生成し、低並列度環境で標準モデル比最大4倍高速
- Nvidia H100 GPU FP8版で毎秒1,008トークン、H200で毎秒1,288トークンを達成
- 26B MoEモデルで推論時3.8Bパラメータのみをアクティブ化する省リソース設計
- オープンソースのvLLM推論プラットフォームでネイティブサポートされる初の拡散言語モデル
Googleが従来の自己回帰型とは全く異なる拡散モデルベースのテキスト生成手法「DiffusionGemma」をオープンソース公開した点は、LLMのアーキテクチャ多様化を示す重要なマイルストーン。特に並列256トークン生成による低レイテンシー・低コスト推論の可能性は、エッジ/オンデバイスAIやリアルタイムアプリケーションへの応用を加速させる。vLLMでのネイティブサポートによりデファクト標準化の可能性もあり、GPUリソースの効率利用という観点から、AIインフラ市場に構造的な影響を与える可能性に注目すべき。