Anthropic、AIのリスク管理のための「責任あるスケーリングポリシー」を発表
Announcing Anthropic's Responsible Scaling Policy
Anthropicは、AIシステムの開発に伴うリスクを管理するための「責任あるスケーリングポリシー(RSP)」を発表した。RSPは、AIモデルの能力向上に伴う壊滅的なリスク(テロリストによる悪用や自律的な意図しない動作による大規模破壊など)に対処するための技術的・組織的なプロトコルである。壊滅的なリスクのレベルに応じてAI安全レベル(ASL)を定義し、ASL-1は無害なシステム、ASL-2はバイオ兵器製造の指示など危険な能力の兆候が見られるが信頼性が低いシステム(現在のClaudeなどが該当)、ASL-3は非AIベースラインと比較して壊滅的な悪用のリスクを大幅に増加させるシステム、ASL-4以上は未定義だが、将来的なリスクと自律性の質的なエスカレーションを想定している。ASL-2の安全基準は現在のホワイトハウスへのコミットメントと重複しており、ASL-3ではより厳格なセキュリティ要件と、敵対的テストでリスクが確認された場合のデプロイ停止が求められる。このポリシーは、AIの安全な開発と有益な応用のバランスを取り、AIのスケールアップが安全手順の遵守能力を超える場合は一時的にトレーニングを中断する可能性がある。ビジネス面では、Claudeの現在の利用や製品提供に影響はないとしている。このポリシーは取締役会によって承認されており、長期便益信託との協議を経て変更される。Anthropicは、このポリシーがAI分野における「トップを目指す競争」を促進し、安全問題の解決へとインセンティブを向けることを期待している。
- Anthropicが取締役会承認を得た「責任あるスケーリングポリシー(RSP)」を発表
- AI安全レベル(ASL)を定義し、ASL-3以上のモデルでは敵対的テストでリスク確認後のデプロイ停止を要件化
- 現在のClaudeはASL-2に該当し、現行の製品提供やビジネスに影響はない
AnthropicがAIリスク管理の枠組み「責任あるスケーリングポリシー(RSP)」を正式に発表し、取締役会承認を得た点は、AI企業が自主規制を制度化する流れを加速させるシグナルだ。特にASL-3到達時にはデプロイ停止という具体的な行動基準を盛り込んでおり、規制リスクに敏感な投資家にとっては業界標準が形成されつつあると捉えられる。また、RSPが「トップを目指す競争」を安全問題の解決へ誘導する設計思想を持つことは、長期的に安全性の高いAI開発企業が競争優位を得る可能性を示唆する。