Anthropic、AIモデル「Claude Fable 5」のサイバーセキュリティ保護機能と「脱獄」フレームワークの詳細を公開
More details on Fable 5’s cyber safeguards and our jailbreak framework
Anthropicは、AIモデル「Claude Fable 5」のグローバル展開を発表し、そのサイバーセキュリティ保護機能とAI脱獄(jailbreak)の深刻度評価フレームワークに関する詳細情報を公開した。同社は、AIモデルに付随する安全分類器(safety classifiers)が、危険なサイバーセキュリティ利用を検出しブロックする仕組みを説明。分類器は、「禁止される利用」「高リスク二重利用」「低リスク二重利用」「無害な利用」の4つのカテゴリに分類し、それぞれに対応したブロックまたは監視を行う。特に、サイバー攻撃に悪用される可能性のある「禁止される利用」や「高リスク二重利用」の活動(例:ランサムウェア開発、脆弱性悪用、ペネトレーションテストなど)はブロック対象となる。また、AI脱獄の深刻度を評価するための「Cyber Jailbreak Severity (CJS)」スケール(CJS-0からCJS-4)を提案。このスケールは、「能力獲得」「能力獲得の広範性」「武器化の容易さ」「発見可能性」の4つの軸に基づいており、AI開発者と政府間のリスクに関する一貫したコミュニケーションを促進することを目的としている。同社は、このフレームワークに関するフィードバックを求めており、セキュリティ研究者向けのHackerOneプログラムも開始した。
- AnthropicがAIモデル「Claude Fable 5」に搭載するサイバーセキュリティ分類器の詳細を公開。4カテゴリ(禁止、高リスク二重利用、低リスク二重利用、無害)に分類し、危険な利用をブロックする仕組みを説明。
- AI脱獄の深刻度を評価する「Cyber Jailbreak Severity (CJS)」スケール(CJS-0〜4)を公開。能力獲得、広範性、武器化の容易さ、発見可能性の4軸で評価するフレームワークを提案。
- セキュリティ研究者向けのHackerOneプログラムを開始。
AnthropicがClaude Fable 5のセキュリティ保護機能として、サイバー攻撃用途のAI利用を4段階に分類してブロックする仕組みと、AI脱獄の深刻度評価フレームワーク(CJSスケール)を公開した点は注目に値する。AIモデルの安全性と悪用防止は、エンタープライズ向けAI需要の拡大に不可欠であり、こうしたガードレールの整備が進む企業ほど、規制対応力や顧客獲得競争で優位に立つ可能性がある。特に政府やセキュリティ重視の業界では導入判断の重要な要素となるため、Anthropicの差別化要因として評価できる。