Habana Gaudi2アクセラレータ上での大規模言語モデルBLOOMZの高速推論
Fast Inference on Large Language Models: BLOOMZ on Habana Gaudi2 Accelerator
Habana Gaudi2アクセラレータは、1760億パラメータを持つ大規模言語モデルBLOOMZの推論を、Nvidia A100 80GBよりも高速に実行できることがベンチマークで示されました。Gaudi2は8つのHabana Processing Unit (HPU) を搭載し、各HPUは96GBのメモリを持ちます。Gaudi2のアーキテクチャは、行列演算を並列処理することでディープラーニングワークフローを高速化します。HabanaのSDKであるSynapseAIはPyTorchとDeepSpeedをサポートし、HPUグラフとDeepSpeed-inferenceが最近追加されました。これにより、BLOOMZ-7BモデルではGaudi2がA100 80GBより2.89倍高速、1760億パラメータモデルでは1.42倍高速でした。第一世代Gaudiも、特に70億パラメータモデルにおいて、A100よりも優れた価格性能比を提供します。これらの機能は🤗 Optimum Habanaライブラリに統合されており、Gaudi上でのモデル展開を容易にします。
- Habana Gaudi2がBLOOMZ-176Bモデルの推論においてNvidia A100 80GBより1.42倍高速なことをベンチマークで実証した
- HabanaのSynapseAI SDKにHPUグラフとDeepSpeed-inferenceサポートが追加された
- Gaudi2上のBLOOMZ-7BモデルでA100 80GBより2.89倍高速な推論性能を達成した
Habana Gaudi2がNvidia A100 80GBをベンチマークで上回った点は、AI推論向けアクセラレータ市場における競争激化を示す。Intel傘下のHabanaがDeepSpeed-Infusion対応により大規模言語モデル推論で優位性を示したことで、Nvidia一強だった市場に選択肢が増え、投資家としてはAI半導体のサプライチェーン分散や価格競争の進展に注目すべきである。