Kimi K3をMI355Xで実行し、B300よりも優れたパフォーマンス/ドルを実現
Running Kimi K3 on MI355X at Better Performance per Dollar Than B300
オープンソースの大規模言語モデル(LLM)であるKimi K3(2.8兆パラメータ)は、そのサイズからNVIDIAのB200 GPUでは単一ノードで動作せず、B300ノードまたは2つのB200ノードが必要となる。AMDのMI355X GPUは288GBのVRAMを持ち、B300 GPUと比較して約2.4倍安価である。MI355Xは、ソフトウェアサポートの課題はあるものの、Kimi K3との互換性があり、1024トークン入力/400トークン出力のベンチマークで、B200ノード(TP16)と比較してノードあたり3.8倍以上の集約スループットと、単一ストリームで1.3倍以上のデコード性能を達成した。B300ノードは集約スループットでMI355Xを1.65倍上回るが、価格差を考慮するとMI355Xはパフォーマンス/ドルで優位に立つ。 speculative decodeの修正により単一ストリーム性能が約2.2倍向上し、prefill最適化ではAITER MLA prefillカーネルの利用により、コールドprefill時間を2〜3倍短縮した。
- AMD MI355X GPUは288GBのVRAMを持ち、NVIDIA B300 GPUと比較して約2.4倍安価である
- Kimi K3(2.8兆パラメータのLLM)をMI355Xで実行し、B200ノードと比較してノードあたり3.8倍以上の集約スループットを達成
- 価格差を考慮するとMI355XはB300ノードに対してパフォーマンス/ドルで優位に立つ
AMDのMI355X GPUが、NVIDIA B300と比較してパフォーマンス/ドルで優位性を持つというベンチマーク結果は、AI向けGPU市場におけるAMDの競争力向上を示す重要なシグナル。特に価格差(約2.4倍安価)を考慮したコスト効率の高さは、AIインフラ投資の意思決定に影響を与える可能性があり、NVIDIAの市場支配に対するAMDの挑戦が具体的な成果として現れ始めている点に注目すべき。