CAISI、DeepSeek AIモデルの評価で性能、コスト、セキュリティ、採用における課題とリスクを発見
CAISI Evaluation of DeepSeek AI Models Finds Shortcomings and Risks
米国商務省国立標準技術研究所(NIST)傘下のAI標準・イノベーションセンター(CAISI)は、中国のDeepSeek社製AIモデル3種(R1、R1-0528、V3.1)と米国のモデル4種(OpenAIのGPT-5、GPT-5-mini、gpt-oss、AnthropicのOpus 4)を19のベンチマークで評価した。その結果、DeepSeekモデルは性能、コスト、セキュリティ、採用の各面で米国の最先端モデルに劣ることが判明した。特にソフトウェアエンジニアリングやサイバータスクでは、米国の最良モデルがDeepSeekの最良モデルよりも20%以上多くのタスクを解決した。コスト面では、同等レベルの性能で米国のモデルが平均35%安価であった。セキュリティ面では、DeepSeekモデルはエージェントハイジャッキング攻撃に対して米国のモデルの12倍、ジェイルブレイク攻撃に対しては94%の悪意ある要求に応じる(米国のモデルは8%)など、脆弱性が顕著であった。また、DeepSeekモデルは米国のモデルと比較して4倍多く不正確で誤解を招く中国共産党の言説を反映した。DeepSeek R1のリリース以降、中国製モデルの採用は急増しており、モデル共有プラットフォームでのDeepSeekモデルのダウンロード数は2025年1月以降約1000%増加した。CAISIは、これらのDeepSeekモデルのセキュリティと検閲に関する欠点が、開発者、消費者、米国の国家安全保障にリスクをもたらす可能性があると指摘している。
- NIST傘下のCAISIがDeepSeek社製AIモデル3種と米国モデル4種を19のベンチマークで評価した結果を公表
NIST傘下のCAISIによるDeepSeek vs 米国モデルの体系的ベンチマーク評価は、中国AIモデルの性能・コスト・セキュリティ面での劣位を公的機関が初めて包括的に検証した点で重要。特に、DeepSeekモデルがジェイルブレイク攻撃に94%応じる脆弱性や、中国共産党の言説を反映する不正確な出力が米国モデルの4倍多い点は、エンタープライズ導入や政府調達におけるリスク評価の重要な判断材料となる。一方、DeepSeek R1リリース後の中国製モデルダウンロード数が1000%増加している事実は、コストやオープン性を優先する市場セグメントが確実に存在することを示しており、投資家は「性能面での米国優位」と「普及面での中国勢の台頭」の二面性を注視すべき。