マルチターン攻撃はAIモデルを88%の時間で破綻させる、単一ターンテストでは見逃されるとシスコのAIセキュリティ責任者が警告
Multi-turn attacks broke AI models 88% of the time — single-turn testing missed it, Cisco AI security lead warns at VB Transform 2026
シスコのAI脅威インテリジェンスおよびセキュリティリサーチ責任者であるエイミー・チャン氏は、15の主要AIモデルに対して6,986回のマルチターン攻撃を実施した結果、攻撃者が会話を通じて適応した場合、88.3%の確率でモデルを突破できたと発表しました。これは、単一ターンでのレッドチーミングプログラムしか実施していない組織にとって懸念すべき数字です。調査によると、企業の54%が既にAIエージェントによるセキュリティインシデントを経験しているか、それに近い状況に遭遇しています。多くの企業では、エージェントごとにスコープされたIDを付与したり、サンドボックスで隔離したりする対策が不十分です。シスコは、105のモデルに対する敵対的評価信号をLLMセキュリティリーダーボードで公開しており、モデルが攻撃にどのように脆弱であるかを理解することの重要性を強調しています。単一ターンテストは一度きりの悪意のあるプロンプトですが、マルチターン攻撃はより現実的な対話シナリオを模倣しており、単一ターンでは見逃される有害な出力を明らかにします。Box社のCISOであるヘザー・セイラン氏は、エージェントのセキュリティ対策として、アクセス権限の管理、エフェメラルサンドボックス環境、ランタイム実行制御の3層構造を提唱しています。Intuit社は、セキュリティ、リスク、不正モデリングを抽象化する中央プラットフォーム「GenOS」を開発し、開発者がセキュリティ対策を再実装する必要がないようにしています。セイラン氏は、開発サイクルの迅速化のため、人間によるコードレビューの時代は終わりを告げ、エージェントがコードの脆弱性をレビューするようになる未来を示唆しましたが、まだ道のりは長いと述べています。攻撃者はエージェントのスキル、データアクセス、ツール利用を通じて攻撃を仕掛けるため、攻撃対象領域が拡大しています。Intuit社は、手動のレッドチーミングで特定された共通の脆弱性パターンを自動化し、GenOSに組み込んでいます。意図検出に関しては、Box社は外部エージェントとの連携における文脈の不透明さが課題であると認識しており、業界内では意図の定量化を重視するMastercard社と、確率に基づくアプローチを取るエンドポイントセキュリティCTOの間で見解が分かれています。チャン氏は、現在のモデルではプロンプトから意図を確実に推測することは困難であり、決定論的な制御と行動プロキシが依然として必要であると説明しました。セイラン氏は、両方の対策が必要であると同意しました。マルチターン攻撃のテストは継続的に行う必要があり、単一ターンテストでは見逃されるリスクがあることが強調されました。
- シスコのAI脅威インテリジェンス責任者エイミー・チャン氏が15の主要AIモデルに対し6,986回のマルチターン攻撃を実施し、88.3%の確率でモデルを突破できたと発表
- 企業の54%が既にAIエージェントによるセキュリティインシデントを経験しているか、それに近い状況に遭遇
- シスコが105のモデルに対する敵対的評価信号をLLMセキュリティリーダーボードで公開
本記事は、AIエージェントの急速な普及に伴い、従来の単一ターンレッドチーミングでは検出できないマルチターン攻撃が88.3%という極めて高い成功率でモデルを突破できる実証結果を報告しており、AIセキュリティ対策市場の拡大を示唆する点で重要。シスコがLLMセキュリティリーダーボードを公開し評価信号を業界共有していること、Box社やIntuit社が具体的なセキュリティ対策フレームワーク(3層構造、GenOS)を打ち出していることから、AIエージェント向けセキュリティソリューションは今後需要が急増する領域であり、関連スタートアップや大手セキュリティ企業の動向を注視すべき。