Cognition、Fable 5.1やGPT-Astraに匹敵する新しいSWE-2モデルを発表
Cognition launches new SWE-2 model, Rivaling Fable 5.1 and GPT-Astra
Cognitionは、同社史上最も高度なコーディングモデルであるSWE-2を発表しました。SWE-2は、FrontierCode 1.1 Mainで50.0%を達成し、Fable 5.1に1ポイント差で迫りながらも、コストは64%削減されています。SWE-2は、マルチトリリオンパラメータ領域に初めて強化学習(RL)をスケールさせ、単一の実行ですべての推論努力レベルをトレーニングするRLアルゴリズムを導入しました。これにより、コストパフォーマンスのフロンティア全体が前進しました。SWE-2は、Kimi K3(2.8Tパラメータモデル)からポストトレーニングされており、エージェントコーディングのための広範なRLを受けています。SWE-2は、FrontierCode 1.1 MainおよびDeepSWE 1.1において、スコアとコストの両方でSWE-1.7およびGrok 4.6を上回り、GPT-5.6 SolおよびFable 5/5.1と同等でありながら、それらの価格のわずかな割合で提供されます。また、GPT-6 Astraには数ポイント差で迫りながら、コストは4分の1です。SWE-2は、Devin Desktop、CLI、Devin Web、Fusionで利用可能です。さらに、SWE-2は、テストカバレッジの向上、リソースの活用、検証規律の強化といった行動パターンを示しています。政治的に機密性の高いトピックに関する評価では、SWE-2は全体で98.0%の合格率を達成しました。
- Cognitionが同社史上最も高度なコーディングモデルSWE-2を発表。FrontierCode 1.1 Mainで50.0%を達成し、Fable 5.1に1ポイント差に迫りつつコストを64%削減。
- マルチトリリオンパラメータ領域に初めて強化学習をスケールさせ、単一の実行で全推論努力レベルをトレーニングするRLアルゴリズムを導入。
- Kimi K3(2.8Tパラメータモデル)からポストトレーニングされ、エージェントコーディング向けの広範なRLを実施。
- FrontierCode 1.1 MainおよびDeepSWE 1.1で、スコアとコストの両面でSWE-1.7とGrok 4.6を上回り、GPT-5.6 SolやFable 5/5.1と同等の性能を低価格で提供。GPT-6 Astraにも数ポイント差でコストは4分の1。
- SWE-2はDevin Desktop、CLI、Devin Web、Fusionで順次利用可能となり商用提供が開始。
Cognitionが新型コーディングモデルSWE-2を投入し、FrontierCode 1.1 Mainで50.0%を達成。Fable 5.1に1ポイント差まで迫りながらコストは64%削減、Grok 4.6やSWE-1.7をスコア・コスト両面で上回る点は、コーディングエージェント市場の価格性能フロンティアを押し上げる重要な変化。Devin Desktop/CLI/Web/Fusionへ即時展開され商用収益に直結する点、Kimi K3からのポストトレーニングに依存する供給構造にも留意したい。