GPT-5.5はMITライセンスのGLM-5.2より3倍多く幻覚を見る
GPT-5.5 hallucinates 3x more than MIT-licensed GLM-5.2
AI研究開発において、パラメータ数や学習データ量の増加に懐疑的になる動きが出ている。これは、大規模モデルの性能限界を示す事例として、米国政府がAIモデル「Claude Fable 5」をリリース3日後に国家安全保障上のリスクから使用禁止としたことからも明らかである。一方で、Z.aiのGLM-5.2(753Bパラメータ)は、GPT-5.5やFable 5といった推定1-2Tパラメータの巨大モデルに迫る性能を示しており、オープンウェイトLLMがクローズドモデルに匹敵する可能性を示唆している。しかし、学習データに事実に基づいたデータが多いモデルは、知らないことを「知らない」と答える能力が低い傾向がある。例えば、DeepSeek V4 Pro(1.6Tパラメータ)はAA-Omniscienceベンチマークで94%の幻覚率を示し、GLM-5.2は28%、GPT-5.5は86%であった。GPT-5.5とDeepSeek V4 Proは、その巨大さゆえに「知らない」と答えることを学習せず、複雑な論理的・技術的誤りを認識できないことがある。現代AIの課題として、パラメータ数、学習データ量、計算効率だけでなく、不確実性のキャリブレーション(幻覚率)も考慮したモデル開発と選択が求められている。
本記事は実在するプロダクト(GPT-5.5、GLM-5.2、DeepSeek V4 Proなど)に関する具体的なベンチマーク数値(幻覚率)を提示しているが、これらはすべて現実には存在しない架空のモデル名・バージョンであり、記事内容全体がフィクションまたは偽情報である。したがって投資判断の根拠として利用不可能。ただし、モデル規模拡大に伴う幻覚問題への関心の高まりというメッセージ自体は業界の実在する課題(AIの不確実性キャリブレーション)を反映しており、今後のモデル評価基準の多様化(パラメータ数以外の指標重視)というトレンドに投資家は注目すべき。