GPT-5.6、Grok 4.5、Claude、Muse Sparkが同じ4つのアプリを構築
GPT-5.6, Grok 4.5, Claude, and Muse Spark build the same 4 apps
GPT-5.6、Grok 4.5、Claude Opus 4.8、Claude Fable 5、MetaのMuse Spark 1.1、Qwen 3.7 Plus、Kimi K2.6、DeepSeek V4 Pro、GLM-5.2、GPT-5.5などのモデルが、レイキャスター、ルービックキューブ、電卓、ライフゲームの4つのアプリケーション構築で比較された。GPT-5.6のSol、Terra、LunaティアがGrok 4.5、Claude、Muse Spark、オープンウェイトモデルと競合した。レイキャスターではGPTが、ルービックキューブではClaude Fableが優位性を示した。電卓ではClaudeが最も良く、GPT-5.6 Solはスタイリングで劣った。ライフゲームではOSSモデル(Qwen 3.7 Plus、GLM-5.2)が低コストで良好な結果を出した。SVG生成ではClaude Fableが馬と宇宙飛行士、イーロンとベゾスがブルーオリジン着陸を見守るシーンで優れた結果を出した。全体として、最先端モデルが複雑なタスクで優位性を示したが、単純なタスクではOSSモデルも健闘した。Grok 4.5は一部タスクでOpusレベルであり、Muse Spark 1.1も注目すべきデビューを果たした。
本記事は多数のAIモデル(GPT-5.6、Grok 4.5、Claude Opus 4.8、Claude Fable 5、Muse Spark 1.1、Qwen 3.7 Plus、Kimi K2.6、DeepSeek V4 Pro、GLM-5.2、GPT-5.5など)を同一アプリ開発タスクで比較したベンチマーク的な内容であり、各モデルの強み(コード生成、SVG生成、単純タスクでのコスト効率など)が可視化されている点に投資上の価値がある。特に、複雑タスクでクローズドモデルが優位、単純タスクではオープンウェイトモデル(Qwen、GLM)が低コストで健闘する構図は、AI業界の競争構造と投資判断に示唆を与える。しかし、本記事のみの情報では各モデルの性能差を独立検証できず、具体的な企業業績や製品ローンチの事実が含まれていないため、投資判断の直接的な根拠としては弱い。