Intel Gaudi ハードウェアを TGI で活用し LLM 推論を高速化
🚀 Accelerating LLM Inference with TGI on Intel Gaudi
Text Generation Inference (TGI) は、Intel Gaudi ハードウェアのサポートをメインコードベースに統合しました。これにより、Gaudi1、Gaudi2、Gaudi3 の全ラインナップが TGI で直接利用可能になり、AWS EC2 DL1 インスタンス、Intel Tiber AI Cloud、Denvr Dataworks、IBM Cloud、および Dell、HP、Supermicro などの OEM からアクセスできます。この統合は、ハードウェアの多様性、コスト効率、プロダクションレディな機能(動的バッチ処理、ストリーミング応答など)、Llama 3.1、Mixtral、Mistral などの人気モデルのサポート、マルチカード推論や FP8 精度のサポートといった先進機能を提供します。公式 Docker イメージを使用して TGI を Gaudi ハードウェア上で実行する基本的な例も示されており、Llama 3.1/3.3、Mistral、Mixtral、CodeLlama、Falcon など、最適化されたモデルのリストも提供されています。FP8 量子化などの高度な機能も利用可能で、将来的には DeepSeek-r1/v3 や QWen-VL などのモデルもサポート予定です。
- Intel Gaudi ハードウェアの TGI サポートがメインコードベースに統合され、Gaudi1/2/3 全ラインナップが利用可能になった
Intel Gaudi シリーズが TGI(Text Generation Inference)のメインコードベースに統合されたことは、AI 推論ワークロードにおける Intel の競争力向上を示す重要な進展。特に FP8 精度やマルチカード推論といったプロダクションレディな機能を備え、AWS、IBM Cloud、Dell、HP、Supermicro など複数のクラウド・OEM からアクセス可能である点は、エコシステムの広がりを感じさせる。Llama 3.1 や Mistral など人気モデルへの対応が進んでおり、Gaudi が NVIDIA GPU 代替としてコスト効率の高い選択肢になり得るかを注視すべき。ただし、現時点では具体的な導入実績や性能ベンチマークの言及がなく、評価は今後の事例待ち。