DeepSeek、指示追従・コード・数学能力を向上させた新モデル「DeepSeek-V3」をリリース
Open R1: Update #4
DeepSeekは、基盤モデルであるDeepSeek-V3を更新した新モデルをリリースしました。この新モデルは、以前のV3モデルと同じアーキテクチャを持ちながら、MITライセンスで提供されます。主な改善点は、指示追従能力、コード生成能力、数学的能力の向上です。MMLU-Proで81.2、GPQAで68.4、AIMEで59.4、LiveCodeBenchで49.2といったベンチマークスコアを達成し、GPT-4.5に匹敵しClaude-Sonnet-3.7を上回る性能を示しています。具体的には、フロントエンドWeb開発、コード実行可能性の向上、中国語の文章能力向上、機能呼び出しの精度向上などが挙げられます。モデルの改善は、継続的な事前学習や、より質の高いデータを用いた事後学習によって達成されたと推測されています。このモデルはHugging FaceのInference Providers(Fireworks, Hyperbolic, Novita)やOpenAIクライアントライブラリ、TGI、SGLang、Unsloth AIのDynamic Quantizationなどを通じて利用可能です。モデルのダウンロードと実行はSafetensors形式や`trust_remote_code=True`の設定により安全に行えますが、コード生成やエージェント利用においては、脆弱性スキャンやサンドボックス利用などの注意が必要です。
- DeepSeekが指示追従・コード生成・数学能力を向上させた新モデル「DeepSeek-V3」をリリース
DeepSeekがDeepSeek-V3のアップデート版をリリースし、MMLU-Pro 81.2、GPQA 68.4、AIME 59.4など複数ベンチマークでGPT-4.5に匹敵しClaude-Sonnet-3.7を上回る性能を示した点は注目に値する。特にMITライセンスでの公開により、商用・研究利用の障壁が低く、オープンソースAIモデルの競争力を一層高める。コード生成や数学能力の改善はエンタープライズ向けAI活用の実用性を押し上げ、Inference ProvidersやOpenAI互換クライアント経由で容易にアクセス可能なため、AIインフラ・ツール市場の競争構造に影響を与える可能性がある。ただし、コード生成・エージェント利用時のセキュリティリスクには引き続き注意が必要。