Universal Assisted Generation: Intel LabsとHugging Faceが開発した、あらゆるアシスタントモデルで高速化を実現する手法
Universal Assisted Generation: Faster Decoding with Any Assistant Model
Intel LabsとHugging Faceは、Universal Assisted Generation(UAG)という新しい手法を発表しました。これは、異なるトークナイザーを持つターゲットモデルとアシスタントモデルのペアでもアシスト生成を可能にし、LLMの推論速度を1.5倍から2.0倍に向上させます。従来のアシスト生成では、ターゲットモデルとアシスタントモデルが同じトークナイザーを共有する必要がありましたが、UAGは2方向のトークナイザー翻訳によりこの制約を解消します。これにより、gemma-2-9bのようなモデルをターゲットに、vicuna-68mのような小型モデルをアシスタントとして利用できるようになります。この技術は🤗 Transformersライブラリのバージョン4.46.0に統合されました。実験では、CodeLlama-13bとtiny_starcoder_pyのペアで1.90倍、Mixtral-8x22B-Instruct-v0.1とvicuna-68mのペアで1.52倍の速度向上が確認されています。
- Intel LabsとHugging FaceがUniversal Assisted Generation (UAG) を発表
- UAGが🤗 Transformersライブラリのバージョン4.46.0に統合された
Intel LabsとHugging Faceが共同開発したUniversal Assisted Generationは、LLM推論の高速化手法において、従来必須だった同じトークナイザーという制約を撤廃した点でブレークスルーといえる。異なるサイズ・アーキテクチャのモデルを任意に組み合わせてアシスト生成できるため、既存の多様なモデル資産を活用した推論最適化が可能になる。特に、巨大モデルと小型モデルのペアで1.5〜2倍の速度向上が確認されており、推論コスト削減やレイテンシ改善に直結する。この技術が🤗 Transformersライブラリに統合されたことで、広範な開発者コミュニティがすぐに利用できる点も投資家として注目すべき。AIインフラやエッジ推論の高速化領域への応用が期待される。