DeepSeek V4 Flashを単一AMD MI300Xで実行するための設定とパッチ
DeepSeek V4 Flash on a Single AMD MI300X
本リポジトリは、deepseek-ai/DeepSeek-V4-Flash-0731モデルを単一のAMD MI300X GPUで本番稼働させるための設定とパッチを提供する。Docker Composeスタック、SHA-256で固定されたファイルオーバーレイ、アップストリームとの差分、チューニングテーブルが含まれる。モデルは追加の重み量子化やオフロードなしで動作する。vLLMの公式レシピはNVIDIAや新しいAMDハードウェアを対象としているが、MI300Xでの安定稼働にはFP8フォーマット、高並列時のMoEルーティング、因果的投機的検証、CPU-KV同期、およびいくつかの未調整カーネル形状に対する修正が必要だった。MI300Xは192GBのHBM3と5.3TB/sのメモリ帯域幅を持ち、H100 SXM5の2.4倍のHBM容量を持つ。この304Bパラメータのチェックポイントでは、メモリ容量により単一GPUでのデプロイが可能で、モデル全体がHBMに収まり、PCIe重みストリーミングやレイヤーオフロードは不要。20GBのGPU KVプールと96GBのCPUティアが利用可能。MI300X (CDNA3) はAMD/GraphcoreのfnuzバリアントのE4M3を実装している。本リポジトリは、ROCmナイトリービルド用の修正、検証済みサービング設定、AITER GEMMチューニングテーブル、およびハイブリッドKV戦略(20GB GPUキャッシュ + 96GB CPUオフロード)を追加している。パフォーマンスチューニングの結果、単一ストリームデコードで168.6トークン/秒、8並列ストリームで542トークン/秒、64ストリームバーストで830トークン/秒を達成し、256Kトークンのコンテキスト長を検証済み。HBM使用量は156.67 GiBで、追加の量子化やオフロードは行われていない。
- DeepSeek V4 Flash 304Bパラメータモデルを単一AMD MI300X GPU上で追加量子化・オフロードなしで本番稼働させる設定とパッチを公開
- 単一ストリームデコード168.6トークン/秒、8並列542トークン/秒、64ストリームバースト830トークン/秒を達成し256Kトークンのコンテキスト長を検証
- MI300Xの192GB HBM3(H100 SXM5の2.4倍のHBM容量)と5.3TB/sメモリ帯域幅により単一GPUデプロイが可能
- FP8フォーマット、高並列時のMoEルーティング、因果的投機的検証、CPU-KV同期などの修正でMI300X安定稼働を実現
DeepSeek V4 Flash(304Bパラメータ)を単一のAMD MI300X GPU上で追加量子化なしに本番稼働させる技術的成果は、NVIDIA H100への依存を低減するAI推論の選択肢拡大を示す。特にMI300XのHBM容量(192GB)が単一GPUでの巨大モデル推論を可能にし、コスト・ハードウェア調達面でのNVIDIA以外の代替が現実的であることを実証している点は投資判断上重要。