CPUは復活する:LLM推論におけるCPU-GPU分割の再考
The CPU is back: Rethinking the CPU-GPU split for LLM inference
近年、LLM推論ではGPUが主流であったが、エージェントAIの台頭や小規模・ローカルモデルへの移行により、CPUの重要性が再認識されている。エージェントAIでは、ツールの実行やコードのサンドボックス化、マルチエージェントの連携といったオーケストレーション作業が増加し、CPUの役割が拡大している。Intelによると、トレーニングワークロードではCPU対GPU比率が1:8であったのに対し、エージェントワークロードでは1:1、あるいは4:1にまでCPUの比率が高まっている。また、レイテンシ、プライバシー、コスト、オフライン可用性の観点から、エッジコンピューティングや特定のドメインに特化した小規模モデル(SLM)の推論において、CPUが有利になるケースが増えている。NVIDIAはエージェントAI向けにVera CPUを発表し、ArmもAGI CPUをローンチするなど、CPU市場の成長が予測されている。vLLMなどのソフトウェアの進化により、CPU上でのLLM推論のパフォーマンスも向上しており、CPUはLLM推論において再び重要な役割を担うようになっている。
- Intelによると、トレーニングワークロードではCPU対GPU比率が1:8だったのに対し、エージェントワークロードでは1:1、あるいは4:1にまでCPUの比率が高まっている
- NVIDIAはエージェントAI向けにVera CPUを発表した
- ArmはAGI CPUをローンチした
- vLLMなどのソフトウェアの進化により、CPU上でのLLM推論のパフォーマンスが向上している
エージェントAIの台頭によりCPUの重要性が再評価されており、CPU-GPU比率がトレーニング時の1:8からエージェントワークロードでは1:1〜4:1へと変化するというIntelのデータは、今後のAIインフラ投資の方向性に影響を与える重要なシグナルだ。NVIDIAのVera CPUやArmのAGI CPUなど、主要プレイヤーの参入によりCPU市場の成長が予測される点も注目に値する。