AIの誤りによる失敗経験のある企業の85%が、次のミスを見つける人間を排除しようとしている
85% of companies burned by an AI mistake are racing to cut the humans who might catch the next one
VB Pulseの調査によると、AIエージェントがテストを通過した後に本番環境で失敗する経験をした企業の49%は、顧客に問題が発生したと報告しており、これは6月の50%からほぼ横ばいです。しかし、自動評価への信頼は7月に13%に上昇し、6月の5%から増加しました。AIの誤りによる失敗を経験した企業の85%は、人間をデプロイメント決定から排除する方向に進んでおり、失敗経験のない企業の61%と比較して高い割合です。これは、自動評価の信頼性が向上しているにもかかわらず、テストを通過したAI機能が顧客に問題を引き起こすという事象が依然として高い割合で発生しているという逆説的な状況を示しています。企業は、自動評価の限界を認識し、人間によるレビューや、運用監視、問題検出ソリューションへの投資を増やしています。特に、失敗経験のある企業は、人間中心のレビューワークフローへの投資を増やす傾向があります。AI評価市場では、OpenAI、Confident AIのDeepEval、Braintrustなどの専門プラットフォームの採用が進んでおり、統合の容易さが主要な購入基準となっています。
- VB Pulse調査で、AIエージェントがテストを通過後に本番環境で失敗した企業の49%が顧客に問題が発生したと報告(6月の50%からほぼ横ばい)
- 自動評価への信頼が7月に13%に上昇(6月の5%から増加)
- AIの誤りによる失敗を経験した企業の85%が人間をデプロイメント決定から排除する方向に進行(失敗経験のない企業の61%と比較)
- OpenAI、Confident AIのDeepEval、BraintrustなどのAI評価プラットフォームの採用が進み、統合の容易さが主要な購入基準
AIエージェントの本番環境での失敗が依然として高頻度で発生する一方、自動評価への信頼は上昇しており、企業は人間によるレビューワークフローとAI評価プラットフォームへの投資を加速させている。OpenAI、DeepEval、BraintrustなどのAI評価市場への投資機会が拡大しており、評価・監視系スタートアップの成長余地を示す点が重要。