DeepSeek-V4: エージェントが実際に利用可能な100万トークンコンテキスト
DeepSeek-V4: a million-token context that agents can actually use
DeepSeek-V4は、長時間の剤的ワークロードに対応するため、従来のモデルが直面していた停止、コンテキスト予算超過、KVキャッシュの増大、ツールコール時の性能劣化といった問題を解決するために開発された。V4-Proは、DeepSeek-V3.2と比較して、単一トークン推論FLOPsを27%削減し、KVキャッシュメモリを10%に削減した。V4-Flashではさらに削減され、FLOPsは10%、KVキャッシュは7%となった。これは、Attention機構をCompressed Sparse Attention (CSA) と Heavily Compressed Attention (HCA) の2つのメカニズムに分割し、層ごとに交互に配置することで実現されている。CSAはKVエントリを4倍圧縮し、HCAは128倍圧縮する。また、FP8やFP4といった低精度ストレージの採用も効率化に寄与している。エージェントのユースケースに特化するため、ツールコールを含むマルチターン会話でも推論履歴を保持する機能や、JSONではなくXMLベースのツールコール形式を採用し、エスケープエラーを削減した。エージェントのトレーニングには、DeepSeek Elastic Compute (DSec) というRustベースのプラットフォームが使用され、関数呼び出し、コンテナ、microVM、フルVMといった複数の実行基盤をサポートする。ベンチマークでは、Terminal Bench 2.0で67.9、SWE Verifiedで80.6、MCPAtlas Publicで73.6、Toolathlonで51.8を記録し、特にエージェント関連タスクで高い性能を示している。現在、4つのチェックポイントが公開されている。
- DeepSeekがDeepSeek-V4(V4-Pro, V4-Flash)を公開
- V4シリーズがCompressed Sparse Attention (CSA) と Heavily Compressed Attention (HCA) を採用
- DeepSeek Elastic Compute (DSec) 実行基盤を公開
DeepSeekがV4でエージェント特化型アーキテクチャ(CSA/HCA)と低精度ストレージにより、推論コストとメモリ消費を大幅に削減した点は競争優位性を強める。特にKVキャッシュを最大93%削減しつつ、ベンチマークで高スコアを達成していることは、エンタープライズ向けAIエージェント市場での実用性を高める。Rustベースの実行基盤DSecの公開も、エコシステム拡大に寄与する可能性が高く、企業向けAI導入コスト削減トレンドの加速材料として注目される。