自己投機的デコーディングによる高速テキスト生成
Faster Text Generation with Self-Speculative Decoding
自己投機的デコーディングは、大規模言語モデル(LLM)のテキスト生成速度を向上させる技術です。従来の投機的デコーディングがドラフトモデルと検証モデルの2つを使用するのに対し、自己投機的デコーディングは単一のモデル内で、早期層でドラフトトークンを生成し、後続の層でそれを検証します。これにより、メモリ使用量と計算遅延が削減され、より小さなGPUへのデプロイが可能になります。この技術は、早期終了層、アンエベディング、および特定のトレーニング手法(レイヤードロップアウトや早期終了損失など)によって実現されます。Hugging Faceの`transformers`ライブラリでは、`generate()`関数に`assistant_early_exit`引数を追加することで実装できます。ベンチマークによると、自己投機的デコーディングは、特にLayerSkipトレーニングレシピで事前学習されたモデルにおいて、従来の自己回帰デコーディングよりも高速であることが示されています。ただし、早期終了層の選択は、生成速度と精度とのトレードオフを考慮して調整する必要があります。
- Hugging Faceのtransformersライブラリが、自己投機的デコーディングをgenerate()関数にassistant_early_exit引数として実装
本記事で紹介されている自己投機的デコーディングは、LLM推論の効率化において重要な技術進展である。特にLayerSkipトレーニングレシピとの組み合わせにより、単一モデル内でドラフト生成と検証を完結させることで、メモリ使用量と計算遅延を削減し、より小型・低コストなGPUへのデプロイが可能になる点が実用的価値が高い。Hugging Face transformersライブラリへの統合が進んでいることも、普及の加速要因となる。LLMの推論コスト削減はAIプロダクトの収益性やスケーラビリティに直結するため、この種の軽量化技術を手掛けるスタートアップやオープンソースコミュニティの動向は投資判断上注目に値する。