Grok 4.5、GPT-5.5、Claudeが同じアプリをビルド
We made Grok 4.5, GPT-5.5, and Claude build the same apps
xAIは、コーディングとエージェント作業のために「Cursorと並行してトレーニングされた」Grok 4.5を発表しました。この記事では、Grok 4.5、GPT-5.5、Claude Opus 4.8、Claude Fable 5の4つのモデルに対し、インタラクティブなHTMLアプリをビルドする3つのプロンプトを与え、その結果を比較しています。最初のタスク(3Dルービックキューブ)では、Claudeモデルが優れていましたが、Grok 4.5はリトライで成功しました。GPT-5.5はキューブのレンダリングに失敗しました。2番目のタスク(パーティクル重力サンドボックス)では、GPT-5.5が最も魅力的で、Grok 4.5、Fable 5、Opus 4.8も機能的なサンドボックスを作成しました。3番目のタスク(プレイ可能なブレイクアウトゲーム)では、すべてのモデルが同等の高品質なゲームを生成しました。速度とコストの比較では、Grok 4.5が最も高速なスループット(110トークン/秒)と最も低いコスト(0.002セント/返信)を達成し、xAIの「時間とコストあたりの知能」という主張を裏付けました。GPT-5.5は短い回答で最も応答が速く、Opus 4.8はバランスが取れており、Fable 5は最も遅く高価でした。ボーナスラウンドのSVG生成では、Fable 5が最もユーモラスなシーンを作成し、GPT-5.5がそれに続きました。Opus 4.8はSVGに重複属性があり、Grok 4.5は指示通りにシーンを生成しました。結論として、Grok 4.5は速度とコストで優位に立ち、Claudeモデルは信頼性が高く、GPT-5.5はスタイリッシュですが、キューブのビルドに失敗しました。
- xAIがGrok 4.5を発表し、コーディングとエージェント作業向けにCursorと並行してトレーニングされた
- Grok 4.5は110トークン/秒のスループットと0.002セント/返信の低コストを達成
- 複数の主要AIモデル(GPT-5.5、Claude Opus 4.8、Claude Fable 5)とのコーディング・ベンチマーク比較結果が公開された
xAIがGrok 4.5をリリースし、既存の主要LLMとの比較ベンチマークが公開された点は、AI競争の現況を把握する上で重要。特にCursorとの連携トレーニングや処理速度・コスト面での優位性は、xAIの「時間とコストあたりの知能」戦略の現実化を示しており、AI業界の競争構図を左右する可能性がある。投資家は各社のモデル性能差よりも、コスト効率と実アプリケーション生成能力における差別化要因に注目すべき。