Real-SWE: プライベートな実世界のエンタープライズコードベースでAIモデルのベンチマークを実施
Real-SWE: Benchmarking AI models on private, real-world, enterprise codebases
Real-SWEは、プライベートで実世界のエンタープライズコードベースを用いて、最先端のAIモデルの評価を行うベンチマークです。各タスクは、実際の企業からライセンスされたプライベートなプロダクションコードベースから抽出され、その複雑性と文脈を伴うエンジニアが直面する問題に対応します。このベンチマークは、プロプライエタリなシステム、ビジネス上の結果を伴う作業、企業固有の複雑性といった要素を考慮に入れています。評価結果によると、Fable 5.1モデルが38.8%の解決率で最も高い性能を示し、次いでGPT-6 Astra (33.8%)、Gemini 3.8 Flash (31.2%) となっています。Real-SWEは、実際の企業でエンジニアが直面するタスクを再現することで、AIコーディングエージェントの実用性を評価することを目指しています。
- Real-SWEは、実際の企業からライセンスされたプライベートなプロダクションコードベースをタスク抽出元とするAIモデル評価ベンチマークを公開した。
- 評価結果ではFable 5.1が解決率38.8%で首位、GPT-6 Astraが33.8%、Gemini 3.8 Flashが31.2%と続き、最先端モデルでも解決率は4割未満にとどまる。
AIコーディングエージェントの実用性を「プライベートな実企業コードベース」で測る新ベンチマークの登場は、モデル選定の評価軸が公開ベンチマークから実務適合性へ移る転換点として注目される。Fable 5.1が38.8%、GPT-6 Astraが33.8%、Gemini 3.8 Flashが31.2%と、首位でも解決率は4割未満にとどまり、エンタープライズ向け自律コーディングの商用化余地と、ベンダー間の性能差が未だ大きいことを示す。ライセンスされた企業コードを評価基盤に用いる設計はデータ調達・プライバシー面の参入障壁となり得るため、このスコア推移はAIコーディング市場の競争優位を測る先行指標として注視したい。