KimiとGLMを大規模に実行するための、より小さく、より速く、より安全な方法
Smaller, faster, safer: running Kimi and GLM at scale
Cloudflareは、Workers AIプラットフォーム上でMoonshotのKimi K-seriesとZ.aiのGLMという大規模言語モデルを効率的に実行するための3つの最適化技術を導入しました。1つ目はKVキャッシュの量子化で、16ビット精度(BF16)から8ビット浮動小数点(FP8)にすることでキャッシュサイズを半減させ、コンテキスト保持能力を倍増させました。これにより、BF16では32リクエストで限界に達するのに対し、FP8では64リクエストまで処理可能になり、スループットが約41%向上しました。2つ目はモデル重みの圧縮で、GLM 5.2では8ビット浮動小数点から4ビット整数(INT4)に圧縮し、チェックポイントサイズを約40%削減し、GPUメモリ使用量を大幅に削減しました。これにより、デコード速度が向上し、より多くのKVキャッシュを保持できるようになりました。3つ目は共有KVキャッシュの保護で、キャッシュページごとにタグを付与し、リクエストが期待するページとタグが一致するか検証することで、キャッシュの破損による誤ったデータ返却を防ぎます。このチェックはスループットとレイテンシに1%未満の影響しか与えず、必要に応じて有効化できます。これらの最適化により、モデルの精度を維持したまま、より多くの顧客をより低コストでサポートできるようになりました。これらの実験と本番トラフィックは、オープンソースの推論サービングフレームワークであるSGLangを使用して実行・ベンチマークされています。
- CloudflareがWorkers AIプラットフォームでKVキャッシュをBF16からFP8に量子化し、キャッシュサイズを半減させ、スループットを約41%向上させた
- GLM 5.2のモデル重みを8ビット浮動小数点から4ビット整数(INT4)に圧縮し、チェックポイントサイズを約40%削減した
- MoonshotのKimi K-seriesとZ.aiのGLMをWorkers AI上で実行するための最適化技術を導入し、モデル精度を維持したままより多くの顧客をより低コストでサポートできるようになった
CloudflareがWorkers AIプラットフォーム上でLLM推論の効率化を進めており、KVキャッシュ量子化(BF16→FP8)によるスループット約41%向上、モデル重みのINT4圧縮によるGPUメモリ削減など、推論コスト最適化の具体的な成果を示している点が注目に値する。エッジ・サーバーレスAI推論市場において、コストパフォーマンスの改善は競争優位性に直結するため、CloudflareのAIインフラ戦略の進展として投資判断に影響する。