動的推測による高速支援生成
Faster Assisted Generation with Dynamic Speculation
本記事では、大規模言語モデルの推論を高速化する技術である「推測的デコーディング」において、動的な推測ルックアヘッド(SL)調整戦略を提案する「動的推測デコーディング」について解説している。従来の固定値またはヒューリスティックに基づくSL調整では最適化が難しかったが、動的推測デコーディングでは、アシスタントモデルの予測に対する信頼度(ソフトマックス値)に基づいて、次のトークン生成を続けるか、ターゲットモデルによる検証に切り替えるかを動的に決定する。これにより、各イテレーションで生成されるドラフトトークンの数を最大化し、ターゲットモデルとドラフトモデルの呼び出し回数を削減することで、レイテンシを大幅に短縮できる。Llama3.2-1BをアシスタントとしてLlama3.1-8Bに使用した場合、最大1.52倍の高速化が観測された。この動的推測デコーディングは、Hugging Face Transformersライブラリのバージョン4.45.0に統合され、デフォルトの動作モードとなった。
- 動的推測デコーディングがHugging Face Transformers 4.45.0に統合され、デフォルト動作モードとなった
本記事の注目点は、推測的デコーディングにおけるルックアヘッド長の動的最適化手法が、Hugging Face Transformersライブラリのデフォルト動作として統合された点である。推論高速化はLLMの運用コスト削減に直結する技術であり、大規模なターゲットモデルの呼び出し回数を削減できる本手法は、推論インフラの効率化に寄与する。特に、Llama3.2-1BをアシスタントとしたLlama3.1-8Bの推論で1.52倍の高速化が確認されており、モデル実装の標準化によって広範なユーザーが恩恵を受ける可能性が高い。Hugging Faceエコシステムにおける実装標準化は、関連技術の普及と周辺サービスの市場拡大につながるため、投資判断上注目すべき動きである。