Google Cloud C4、IntelおよびHugging Faceとの連携でGPT OSSのTCOを70%改善
Google Cloud C4 Brings a 70% TCO improvement on GPT OSS with Intel and Hugging Face
Google Cloudは、Intel Xeon 6プロセッサ(開発コード名Granite Rapids)を搭載したC4 VMインスタンスが、オープンソースの大規模言語モデル(LLM)であるGPT OSSのテキスト生成において、旧世代のC3 VMインスタンスと比較して総所有コスト(TCO)で1.7倍の改善を達成したと発表しました。C4 VMは、vCPUあたりのスループットで1.4倍から1.7倍向上し、時間あたりの価格も低くなっています。この改善は、IntelとHugging Faceが共同で最適化したエキスパート実行機能(PR #40304)により、各エキスパートがルーティングされたトークンのみを処理するように変更され、計算の冗長性が排除されたことが寄与しています。ベンチマークでは、C4 VM(Intel Xeon 6プロセッサ搭載)とC3 VM(第4世代Intel Xeonプロセッサ搭載)のGPT OSS推論性能が比較され、C4 VMがバッチサイズ64で1.7倍のvCPUあたりのスループット向上を示しました。これにより、同等の生成トークン量に対してC3 VMの1.7倍のコスト削減が可能となり、TCOで70%の改善が見込まれます。この結果は、大規模なMixture of Experts(MoE)モデルが、次世代汎用CPU上で効率的に提供できることを示しています。
- Google CloudがIntel Xeon 6プロセッサ搭載のC4 VMインスタンスを発表し、GPT OSS推論において旧世代C3 VM比でTCO70%改善を達成
- IntelとHugging Faceがエキスパート実行機能(PR #40304)を共同で最適化し、MoEモデルの推論効率を向上
Google CloudがIntel Xeon 6(Granite Rapids)を搭載したC4 VMで、GPT OSSの推論TCOを70%改善した点は、CPUベースの推論がコスト競争力を高めていることを示す。これまで大規模LLM推論はGPUが支配的だったが、IntelとHugging Faceの共同最適化(エキスパート実行機能)により、MoEモデルが汎用CPU上でも効率的に動作可能であることが実証された。データセンター向けCPU需要の下支え要因となり得るほか、GPU不足が続く環境下での代替選択肢として注目に値する。