多様なシナリオにおける特殊および汎用顔表情認識システムの堅牢性の評価
Evaluating the robustness of specialized and general-purpose facial expression recognition systems across varied scenarios
本研究では、制御された静止画像(ADFES, WSEFEP)からより現実的な動的記録(RAVDESS, CREMA-D)まで、複雑さが異なる4つのベンチマークデータセットにおける顔表情認識(FER)システムの包括的な評価を行った。評価対象は、従来のFERニューラルネットワークモデル、汎用ビジョン言語モデル(VLM)、および商用ソフトウェアFaceReader© 10の3カテゴリーである。結果として、制御されたデータセットでの性能は現実世界のFER能力を大幅に過大評価しており、静止データセットでの平均加重および非加重平均リコール値が約72%から自然な設定では30%未満に低下した。全てのモデルで幸福への顕著なバイアスが見られ、特にVLMでは恐怖や怒りのような感情がF1スコアほぼゼロで誤分類されることが多かった。ニューラルネットワークの中では、AfectNetデータセットで訓練されたDANモデルが最も高い汎化性能を示し、全てのVLMを上回った。FaceReader© 10は理想的な条件下で優れた性能を発揮したが、動的なシナリオでは大幅に低下し、CREMA-Dではランダム分類器を下回った。これらの発見は、現実世界のFERにおける汎用VLMや商用ツールの限界を浮き彫りにし、自然な変動性に対処するために明示的に設計されたモデルの必要性を強調している。
- 顔表情認識システムの評価で、制御された静止データセットでの平均リコール約72%が現実的な動的設定では30%未満に低下した
- AfectNetデータセットで訓練されたDANモデルが全ての汎用VLMを上回る汎化性能を示した
- 商用ツールFaceReader© 10はCREMA-D動的データセットでランダム分類器を下回る性能に低下した
本論文は顔表情認識(FER)システムの実世界性能を評価した学術研究であり、商用ツールや汎用VLMが現実環境で劣化することを定量的に示した。投資家視点では、実環境性能を謳うAI製品の妥当性検証の重要性と、自然変動に対応した専用モデルの開発余地を示唆しており、AI応用企業の技術評価に有用な指標を提供する。