Intel Xeon CPU上で動作する効率的な生成AI体験「Q8-Chat」
Smaller is better: Q8-Chat, an efficient generative AI experience on Xeon
大規模言語モデル(LLM)は、その巨大なパラメータ数と高い計算能力要求から、多くの組織にとって導入コストが課題となっていた。本記事では、LLMのサイズと推論レイテンシを削減する最適化技術、特に量子化に焦点を当てる。量子化は、モデルのパラメータを低精度(例:INT8)に変換することで、モデルサイズを少なくとも2倍削減し、推論速度を向上させる技術である。従来の量子化手法はLLMの活性化チャネルにおける外れ値に弱点があったが、新しい技術であるSmoothQuantは、重みと活性化に共同の数学的変換を適用することで、この問題を解決し、モデルの品質を損なわずに8ビット量子化を可能にする。IntelはSmoothQuantを用いてOPT、LLaMA、Alpaca、Vicuna、BloomZ、MPTなどのLLMを量子化し、Intel Xeon CPU上で効率的に動作するデモ「Q8-Chat」を公開した。これにより、ChatGPTのようなチャット体験を、高性能なAIアクセラレーターなしで、より低コストで実現できる可能性が示された。Hugging Face Optimum Intelライブラリにもこれらの量子化技術が統合される予定である。
- IntelがSmoothQuantを用いて量子化したLLMをXeon CPU上で動作させるデモ「Q8-Chat」を公開
- 量子化技術がHugging Face Optimum Intelライブラリに統合される予定
IntelがSmoothQuant技術を用いて主要なLLMを8ビット量子化し、専用AIアクセラレーターなしにXeon CPU上で実用的なチャット体験を実現した点は、推論コストの大幅な引き下げとCPUベースのAIインフラの現実性を示している。GPU不足や高騰が課題となる中、Intelのx86サーバーを活用したAI推論の選択肢が増えることは、エンタープライズ導入の障壁を下げ、CPU市場におけるIntelの競争力を維持する可能性がある。Hugging Face Optimum Intelへの統合もエコシステム拡大に寄与し、AI推論の民主化というトレンドを加速させる点で注目に値する。