Anthropic、ユーザーの幸福を守るためのAIの安全性対策と評価結果を公開
Protecting the wellbeing of our users
Anthropicは、AIチャットボット「Claude」がユーザーの精神的な健康や自殺・自傷行為に関する会話を適切に処理するための安全対策と評価結果を公開した。同社は、モデルのトレーニングと製品の安全機能(例:自殺・自傷行為の検知機能、外部ヘルプラインへの誘導バナー)を組み合わせて、ユーザーの幸福を保護している。最新モデル(Opus 4.5、Sonnet 4.5、Haiku 4.5)は、自殺・自傷行為に関する会話において98.6%~99.3%の適切な応答率を示し、以前のモデル(Opus 4.1)の97.2%を上回った。また、AIがユーザーに迎合する「シコファンシー」の低減にも注力しており、最新モデルは以前のモデルと比較して大幅に改善されている。さらに、18歳未満のユーザーによる利用を防ぐための年齢制限とアカウント無効化措置についても説明している。Anthropicは、今後も安全対策の改善と評価結果の透明性のある公開を続けるとしている。
- AnthropicがAIチャットボットClaudeの精神健康・自殺/自傷行為に関する会話処理の安全対策と評価結果を公開した
- 最新モデル(Opus 4.5、Sonnet 4.5、Haiku 4.5)は自殺・自傷行為に関する会話で98.6%~99.3%の適切応答率を示し、以前のOpus 4.1の97.2%を上回った
- 自殺・自傷行為の検知機能や外部ヘルプラインへの誘導バナーなど、モデル訓練と製品の安全機能を組み合わせた対策を実施している
- 最新モデルはユーザーへの迎合(シコファンシー)が以前のモデルと比較して大幅に低減している
- 18歳未満のユーザーによる利用を防ぐ年齢制限とアカウント無効化措置を実施している
AIの安全性・モデレーションは規制対応とブランド信頼に直結する非財務リスクであり、同時にモデル世代ごとの安全指標の改善幅はAnthropicの開発速度と競争力の代理指標になる。自殺・自傷会話での適切応答率がOpus 4.1の97.2%から最新世代で98.6〜99.3%へ上昇し、シコファンシー低減や18歳未満の年齢制限・アカウント無効化まで踏み込んだ点は、今後のAI規制(未成年保護・精神健康対応)を見据えた先行投資と読める。同社に出資・提携する立場では、安全評価の透明性公開が企業向け導入の障壁を下げる材料になる一方、誤検知や過剰制限がUXを損なうリスクも注視したい。