A.I.AI
ソフトウェアエンジニアリングタスクにおける13のモデルと4のエージェント:Go、Java、Python、Rust、TS
13 Models and 4 Agents on SWE Tasks: Go, Java, Python, Rust, TS
YHacker News
AIが原文を翻訳・要約しています
この記事は、Go、Java、Python、Rust、TypeScriptといったプログラミング言語を用いたソフトウェアエンジニアリングタスクにおける、13のモデルと4のエージェントの性能を比較評価した結果をまとめている。評価項目は、問題解決率(Resolved Rate)、Pass@5(5回の試行で少なくとも1回成功する確率)、問題あたりのコスト(Cost per Problem)、問題あたりのトークン数(Tokens per Problem)である。Fable 5 [high] Modelが64.5%の解決率と78.4%のPass@5を記録し、最も高い性能を示した。コスト面ではCursor Agentが$0.41と最も安価であった。多くのモデルやエージェントで「N/A」と表示されており、詳細なデータが提供されていないものも含まれる。
KEY POINTS要点記事から抽出した重要情報
- ソフトウェアエンジニアリングタスクにおいて13のモデルと4のエージェントを比較評価したベンチマーク結果が公開された。
- Fable 5 [high] Modelが64.5%の解決率と78.4%のPass@5を記録し、最も高い性能を示した。
- コスト面ではCursor Agentが問題あたり$0.41と最も安価だった。
CONTEXT文脈編集部による背景整理
AIエージェント・コーディングモデルの性能ベンチマークは、LLM分野の競争力評価において重要な指標であり、投資判断の材料となる。特にFable 5 [high]モデルが64.5%の解決率を記録し、Cursor Agentがコスト面で優位($0.41/問題)にあることは、今後のAIコーディング市場の競争構図を理解する上で有用である。
原文を読むAnalyzed at 2026年8月1日 08:42