A.I.AI
DeepSeek V4 Flash 0731、Terminal-Bench 2.1で82.7%を達成
DeepSeek V4 Flash 0731: 82.7% on Terminal-Bench 2.1 with a public harness
YHacker News
AIが原文を翻訳・要約しています
DeepSeek V4 Flash 0731が、Terminal-Bench 2.1において82.7% ±1.79 SEの精度を達成し、公開されているベンチマーク結果の中でトップクラスの性能を示しました。このモデルは、38.9分の実行時間と68.41ドルのコストでこの結果を出しています。比較対象として、Grok 4.5mediumは80.9%、GLM 5.2は74.6%、DeepSeek V4 Proは69.1%の精度でした。一方、Vals AIのTerminal-Bench 2.1リファレンスでは、Claude CodeAnthropicのFable 5xhighが83.8%で最高精度を示しています。
KEY POINTS要点記事から抽出した重要情報
- DeepSeek V4 Flash 0731がTerminal-Bench 2.1で82.7%±1.79 SEの精度を達成し、公開ベンチマーク結果でトップクラスを示した
- 同ベンチマークでGrok 4.5mediumが80.9%、GLM 5.2が74.6%、DeepSeek V4 Proが69.1%の精度を記録
- Vals AIのTerminal-Bench 2.1リファレンスではAnthropicのFable 5xhighが83.8%で最高精度
CONTEXT文脈編集部による背景整理
AIモデルのベンチマーク性能比較はモデル競争の現状を示しており、特にDeepSeek V4 Flashが低コスト・短時間で高い精度を達成している点は、AIモデル市場における競争力とコスト効率の観点から投資判断に有用。ただし、単一ベンチマーク結果であり、製品化や収益化への直接的な影響は限定的。
原文を読むAnalyzed at 2026年8月10日 04:35