レッドチーミング耐性リーダーボードの紹介
Introducing the Red-Teaming Resistance Leaderboard
Haize Labsは、Hugging Faceの協力を得て、大規模言語モデル(LLM)の安全性と堅牢性を評価するための「Red Teaming Resistance Benchmark」を発表しました。このベンチマークは、既存の自動化されたレッドチーミング手法が現実的でない、または容易に回避可能であるという問題意識から、人間が作成した高品質で自然言語に近いプロンプトを用いて、LLMの脆弱性を体系的に調査します。AdvBench、AART、Beavertails、Do Not Answer (DNA)、RedEval-HarmfulQA、RedEval-DangerousQA、Student-Teacher Prompting (STP)、SAPといった複数のレッドチーミングデータセットを統合し、ヘイトスピーチ、児童への危害、身体的危害、マルウェア、詐欺、プライバシー侵害、経済的詐欺、医療・法律に関する無許可の助言、成人向けコンテンツ、性的コンテンツなど、OpenAIの利用規約に基づいた20以上のカテゴリに分類して評価します。評価結果によると、GPT-4やClaude-2といったクローズドソースモデルが依然として高い堅牢性を示していますが、API経由での提供のため、モデル自体の性能か追加の安全対策によるものかは不明です。モデルは成人向けコンテンツ、身体的危害、児童への危害を誘発するような攻撃に対して最も脆弱である一方、プライバシー侵害や専門的な助言、政治的キャンペーンに関する攻撃には比較的強い傾向が見られました。Haize Labsは、今後より動的な堅牢性評価手法や、強力なレッドチーミングアルゴリズムをベンチマークに組み込むことを目指しています。
- Haize LabsがHugging Faceの協力でRed Teaming Resistance Benchmarkを発表
Haize LabsがHugging Faceと協力し、LLMの安全性を評価する統合ベンチマークを発表した点は、AI安全性市場の形成を示唆する。現状ではGPT-4やClaude-2などクローズドソースモデルが高い堅牢性を示す一方、成人向けコンテンツや身体的危害への脆弱性が顕在化しており、AIレッドチーミングツールや安全性評価サービスの需要拡大につながる。Haize Labsのようなスタートアップが評価基準の標準化を狙う動きは、AIガバナンス領域での投資機会となり得る。