AprielGuard: 安全性と敵対的堅牢性のためのLLMシステム向けガードレール
AprielGuard: A Guardrail for Safety and Adversarial Robustness in Modern LLM Systems
ServiceNow AIは、80億パラメータの安全・セキュリティガードレールモデル「AprielGuard」を発表した。このモデルは、毒性、ヘイトスピーチ、性的コンテンツ、偽情報、自己危害、違法行為など16カテゴリーの安全リスク、およびプロンプトインジェクション、ジェイルブレイク、連鎖思考の破損、コンテキストハイジャック、メモリポイズニング、マルチエージェントの悪用シーケンスなどの広範な敵対的攻撃を検出するように設計されている。また、エージェントワークフローにおける安全違反や敵対的攻撃も検出可能。AprielGuardは、必要に応じて説明可能な分類を可能にする「推論モード」と、本番パイプライン向けの低レイテンシ分類を可能にする「非推論モード」で利用できる。従来の分類器が限定的なスペクトルに焦点を当て、短い入力を想定するのに対し、AprielGuardはマルチターン会話、長いコンテキスト、構造化された推論ステップ、ツール支援のマルチステップワークフロー(エージェント)といった現代のLLMエージェントエコシステム向けに、統一されたモデルと統一された安全+敵対的分類法を提供する。モデルは、スタンドアロンプロンプト、マルチターン会話、エージェントワークフロー(ツール呼び出し、推論トレース、メモリ、システムコンテキスト)の3つの入力形式で動作する。合成データ、データ拡張、エージェントワークフロー、長文コンテキストのユースケースを含む多様なデータセットでトレーニングされており、32kトークンまでのシーケンス長に対応する。公開ベンチマーク、内部エージェントワークフローベンチマーク、長文コンテキストベンチマーク、および8言語での多言語評価で性能が検証されている。主な限界として、専門分野でのパフォーマンス低下、レイテンシと解釈可能性のトレードオフ、推論モードの感度などが挙げられる。
- ServiceNow AIが80億パラメータの安全・セキュリティガードレールモデル「AprielGuard」を発表
ServiceNowが80億パラメータのLLMセキュリティガードレールモデル「AprielGuard」を発表した点は、エンタープライズ向けAIセキュリティ市場の競争激化を示す。従来の分類器がカバーしないマルチターン会話やエージェントワークフローに特化している点が差別化要因であり、ServiceNowがAIエージェントプラットフォームとしての自社エコシステムを強化する戦略と見られる。企業がLLMを本番運用する際の安全性・コンプライアンス需要が高まる中、ガードレール技術は今後重要な収益源となり得る。競合のNVIDIA NeMo GuardrailsやGuardrails AIなどと比較して、エージェントワークフローへの対応や32kトークンの長文コンテキスト処理が優位性だが、専門分野での性能低下やレイテンシのトレードオフなどの限界にも注意が必要。