Google Cloud上の第5世代Xeonでの言語モデルパフォーマンスベンチマーク
Benchmarking Language Model Performance on 5th Gen Xeon at GCP
この記事では、Google CloudのC4インスタンス(第5世代Intel Xeonプロセッサ搭載)とN2インスタンス(第3世代Intel Xeonプロセッサ搭載)を使用して、エージェント型AIの主要コンポーネントであるテキスト埋め込みとテキスト生成のパフォーマンスをベンチマークしました。特に、第5世代Xeonに搭載されたIntel AMX(Advanced Matrix Extensions)がAIパフォーマンスを向上させる効果を検証しました。ベンチマークには、Hugging Faceのoptimum-benchmarkライブラリとoptimum-intelバックエンドを使用し、WhereIsAI/UAE-Large-V1モデル(テキスト埋め込み)とmeta-llama/Llama-3.2-3Bモデル(テキスト生成)を対象としました。結果として、C4インスタンスはN2インスタンスと比較して、テキスト埋め込みで約10倍から24倍、テキスト生成で約2.3倍から3.6倍のスループット向上が見られました。これにより、CPU上でエージェント型AIソリューションをデプロイする可能性が示唆されています。
- Google CloudがC4インスタンス(第5世代Xeon)でテキスト埋め込みとテキスト生成のベンチマークを実施し、N2インスタンス比で最大24倍のスループット向上を確認
第5世代Intel XeonのAMX拡張による推論性能の大幅向上(埋め込みで10-24倍、生成で2.3-3.6倍)が実証された点は重要。これは、GPUに依存せずCPU上でエージェント型AIを運用する道を開くものであり、クラウドインフラコストの最適化やAI推論の低遅延化に貢献する可能性がある。IntelのサーバーCPU競争力の再評価や、Google CloudのC4インスタンスの差別化要因として投資家は注視すべき。