Qwen 3.8-MaxとClaude Opus 5のベンチマークスコアだけでは請求額は予測できない理由
Qwen 3.8-Max and Claude Opus 5 show why raw benchmark scores don't predict the bill
AlibabaはQwen 3.8-Maxをリリースしたが、独立したベンチマークではその性能が期待ほどではない可能性が示唆された。この差は、トークンと時間の予算設定の違いに起因する。Alibabaはコーディングテストで5時間まで、PaperBenchでは12時間までを許容しているのに対し、独立したベンチマークであるVulcanBenchは45〜60分しか許容していない。この時間予算の違いが、結果の大きな差を生んでいる。モデル選択においては、成功したタスクあたりのコスト(失敗した試行を含めた総費用÷成功したタスク数)を指標とし、時間またはトークン予算を明示的な受け入れ基準に含めることが推奨される。また、ベンチマーク結果は、時間効率を暗黙的に測定しているため、単なる価格比較だけでなく、成功したタスクあたりのコストを考慮する必要がある。多くのグループが独立して「成功タスクあたりのコスト」を算出し始めており、VulcanBenchやLong-Horizon-Terminal-Benchなどがその例である。ベンダー側も、HubSpotやZendeskなどが成功報酬型の課金モデルを導入している。今週の変更点として、エージェント実行ごとに失敗理由(予算超過、検証失敗、ハーネスエラーなど)を区別して出力すること、モデルごとではなく努力レベルごとの計算コストを算出すること、トークンキャップをウォールクロックキャップの代わりに設定すること、デフォルト設定を確認することが挙げられている。
- AlibabaがQwen 3.8-Maxをリリースしたが、独立したベンチマーク(VulcanBench)では期待ほどの性能を示さず、評価条件(時間・トークン予算)の差が結果の乖離を生んでいる
- モデル選定において「成功タスクあたりのコスト」(失敗試行を含めた総費用÷成功タスク数)を指標とする考え方が広がり、VulcanBenchやLong-Horizon-Terminal-Benchなどが独立にこの指標を算出している
- ベンダー側でもHubSpotやZendeskなどが成功報酬型の課金モデルを導入している
AIモデルのベンチマーク評価方法の変化に注目すべき。AlibabaのQwen 3.8-Maxは発表時のベンチマークと独立評価(VulcanBench)で結果が乖離しており、評価条件(時間・トークン予算)の差が性能評価を左右する。投資家としては、モデル選定時に単純なベンチマークスコアではなく「成功タスクあたりのコスト」を指標とすることが重要であり、エージェント実行の品質評価とコスト最適化の動向はAI分野全体の投資判断に影響する。