Anthropicのブラウザエージェント、セーフガード作動前に31.5%が乗っ取られる
Anthropic’s browser agent got hijacked 31.5% of the time before safeguards engaged
Anthropicの最新モデルにおいて、ブラウザ経由でのプロンプトインジェクション攻撃がセーフガード作動前に31.5%の確率で成功したことが明らかになった。これは、OpenAI、Google、Metaといった競合他社が公開した数値と比較して高い割合である。Anthropicは244ページにわたる報告書で、4つの異なるエージェント表面(サーフェス)でのテスト結果を公開したが、他の企業は1つまたは公開していない。プロンプトインジェクションは、Webページや文書などに悪意のある指示を隠蔽し、情報漏洩や不正な操作を引き起こす可能性がある。業界標準の測定方法が存在しないため、各社が独自に指標を設定しており、直接的な比較が困難な状況である。Anthropicの報告書では、コーディング環境では7.03%の成功率だったものが、ブラウザ環境では31.5%に上昇した。セーフガードを有効にすると、ブラウザ環境での成功率は0.5%まで低下する。一方、OpenAIはコネクタに対する既知の攻撃に対する堅牢性スコアとして0.963を報告しており、これはAnthropicのブラウザ環境での攻撃成功率とは異なる指標である。GoogleとMetaは、プロンプトインジェクションに関する具体的な数値を公開していない。
- Anthropicがブラウザエージェントのプロンプトインジェクション攻撃成功率31.5%を含む244ページのセキュリティ報告書を公開
- Anthropicのブラウザ環境での攻撃成功率がセーフガード有効時には0.5%まで低下することが確認された
Anthropicがブラウザエージェントに対するプロンプトインジェクション攻撃の成功率を31.5%(セーフガード未実装時)と競合他社より詳細に公開した点は、AIエージェントのセキュリティ実装が競争優位性に直結することを示唆する。他社が数値を非開示にしている中で、Anthropicは244ページの詳細報告書を公開しており、透明性を競争軸に据える戦略と見られる。一方で、セーフガード有効時には0.5%に低下することも確認されており、セキュリティ対策の実装段階にあることも明らか。投資家は、エージェント普及に向けたセーフガード技術の進展度合いと、各社の開示姿勢の差に注目すべき。