A.I.AI
Terminal-Bench-Science 0.1: AIエージェントの科学研究ワークフロー評価ベンチマーク
Terminal-Bench-Science: Evaluating AI agents on scientific research workflows
YHacker News
AIが原文を翻訳・要約しています
スタンフォード大学の研究者らが主導する「Terminal-Bench-Science 0.1」は、AIエージェントの科学研究ワークフローにおける能力を評価する新しいベンチマークです。このベンチマークは、実際の科学研究から抽出された70のタスクを含み、生命科学、物理科学、地球科学、数学、工学の分野を網羅しています。最初のリリースでは、評価されたモデルの中でClaude Opus 5が30.0%の解決率を達成しました。このベンチマークは、科学界のニーズとAI開発の間のフィードバックループを形成し、科学研究を支援するAIエージェントの開発を促進することを目的としています。継続的なベンチマークとして進化し、将来的にはタスクの追加や改善が行われる予定です。Terminal-Bench-Science 0.2の開発も進行中です。
KEY POINTS要点記事から抽出した重要情報
- スタンフォード大学の研究者らがTerminal-Bench-Science 0.1を公開。実際の科学研究から抽出した70タスクでAIエージェントの科学研究ワークフロー能力を評価する
- 初回評価でClaude Opus 5が30.0%の解決率で最高スコアを達成
- 生命科学、物理科学、地球科学、数学、工学の分野をカバーし、継続的ベンチマークとして発展。Terminal-Bench-Science 0.2の開発も進行中
CONTEXT文脈編集部による背景整理
AIエージェントの科学研究ワークフロー評価ベンチマークの登場は、AIが科学研究分野で実用段階に入りつつあることを示す指標。特にClaude Opus 5が30.0%の解決率でトップとされる点は、AIモデルの科学研究応用能力の進展を示す数値であり、AI分野への投資判断における競合優位性の評価材料となる。
原文を読むAnalyzed at 2026年8月28日 11:01