GPT-5.6 vs. Claude Fable 5: 物理AIにおける性能比較
GPT-5.6 vs. Claude Fable 5 for Physical AI, which performs best?
物理AIの性能は、モデル化された物理法則の正確性に依存する。エージェントAIは、テストがエージェント自身によって書かれるため、この失敗モードを悪化させる可能性がある。JuliaHubは、複数のエージェントバックエンドを持つDyad AIハーネスを使用し、ユーザーにとって最良の体験を提供するため、どのモデルが物理モデリングに優れているかを調査した。OpenAIのGPT 5.6ファミリー(terra, sol, luna)とAnthropicのclaude-fable-5を対象に、52回の実行を含む比較試験を実施した。試験では、コンパイルは通るが物理的に誤っている可能性のある問題を5つ使用し、コードではなくシミュレーション結果を評価した。結果として、Claude Fable 5は最も高い難易度加重スコア(0.889)を達成し、4つのコア問題すべてで12回のトライアルをクリアし、未解決のHL-20問題でも最良の結果を示した。一方、GPT 5.6 Solはコストパフォーマンスに優れ、2番目に高いスコア(0.814)を記録した。Terraは最も安価で高速だったが、Lunaは全項目で最下位だった。また、Dyad AIハーネスのような専用ツールを使用した場合、モデル自体の性能差よりもツールの性能差の方が大きいことが示された。具体的には、同じモデルでもDyadハーネスを使用した場合のスコアは0.899、汎用コーディングエージェントでは0.533となり、ツールの選択が物理的な正しさにより大きく影響することが示唆された。
- Claude Fable 5が物理AIテストで最高難易度加重スコア0.889を達成
- GPT-5.6 Solがコストパフォーマンスに優れ2番目に高いスコア0.814を記録
- 専用ツール(Dyad AIハーネス)使用時と汎用ツール使用時で同じモデルでもスコアが0.899 vs 0.533と差が生じた
本記事は、物理AI領域における主要モデル(GPT-5.6ファミリー vs Claude Fable 5)の性能比較を、独自のテストハーネスを用いて実証した点が重要。特に、モデル自体の性能差(Claude Fable 5が最高スコア0.889、GPT-5.6 Solが0.814)よりも、専用テストツール(Dyad AIハーネス)の有無による性能差(0.899 vs 0.533)の方が大きいという発見は、AIエージェントの実運用における評価基盤の価値を示唆している。投資家は、モデル単体の性能競争に加え、評価・検証インフラを提供する企業(JuliaHub, Dyad等)のポジショニングにも注目すべきである。