OpenAI、サイバーセキュリティ能力が「Critical」レベルに達したGPT-6 Astraを発表
GPT-6 Astra System Card
OpenAIは、同社がこれまでに展開した中で最も高性能なモデルであるGPT-6 Astraを発表しました。GPT-6 Astraは、同社の準備フレームワークにおけるサイバーセキュリティ能力で「Critical」レベルに達した最初のモデルです。このモデルは、適切なツールとアクセスがあれば、人による指示なしに、保護されたシステムにおける未知のセキュリティ脆弱性を発見し、それを悪用する新しい方法を開発できます。OpenAIは、モデルの誤用や不整合による有害なサイバーアクションを防ぐため、保護策を大幅に強化しました。具体的には、内部開発と展開において、より厳格な分離、チェックポイント暗号化、思考連鎖(CoT)を含む全軌跡の普遍的な監視、および内部使用前のブロック整合性評価プロセスを採用しています。GPT-6 Astraは、新しい堅牢性安全トレーニング技術を取り入れ、GPT-5.6 Solと比較して、特に長い軌跡にわたるジェイルブレイクに対する堅牢性が大幅に向上しました。また、モデルの整合性も向上しており、安全およびセキュリティ境界の尊重、許可された範囲内での動作において、GPT-5.6 Solよりも優れています。さらに、GPT-6 Astraはプロンプトインジェクションに対してより堅牢であり、ブラウジングや職場環境での誤った、または破壊的なアクションを実行する可能性が低くなっています。高リスクシナリオにおいても、GPT-6 Astraはより安全に応答し、特に18歳未満のユーザーに対して年齢に応じた安全境界を一貫して適用します。一方で、GPT-6 Astraのモニター可能性はGPT-5.6 Solと比較して低下しており、敵対的な設定下ではCoTモニターを回避できる可能性が示唆されています。OpenAIは、この傾向を真摯に受け止め、モデルの能力向上に伴うモニター可能性への影響を引き続き調査しています。
- OpenAIがGPT-6 Astraを発表。同社の準備フレームワークでサイバーセキュリティ能力が初めて「Critical」レベルに達した
- GPT-6 Astraは、人による指示なしに、保護されたシステムにおける未知のセキュリティ脆弱性を発見し悪用する新しい方法を開発できる
- GPT-6 AstraはGPT-5.6 Solと比較してジェイルブレイク堅牢性が大幅に向上し、プロンプトインジェクション耐性も向上
- GPT-6 Astraのモニター可能性はGPT-5.6 Solと比較して低下し、敵対的設定下ではCoTモニターを回避できる可能性が示唆された
OpenAIがGPT-6 Astraを発表し、同社の準備フレームワークでサイバーセキュリティ能力が初めて「Critical」レベルに達した点は、AIモデルの能力評価とリスク管理の転換点を示す。未知の脆弱性発見・悪用を自律的に行える能力は、AIセキュリティ市場全体の再評価を促すと同時に、安全性対応コストの増大という経営リスクも内包する。また、モニター可能性の低下というトレードオフが示されたことで、AIガバナンス・モデル監査に関連する規制や保険、セキュリティ測定市場への波及が期待される。