Mamba Fusion Adapterとフレームレベル特徴配置によるパラメータ効率的な音声・視覚動的顔表情認識
Parameter-Efficient Audio-Visual Dynamic Facial Expression Recognition with Mamba Fusion Adapters and Frame-Level Feature Arrangement
動的顔表情認識(DFER)は、人間のような共感技術に不可欠な役割を果たす。本研究では、パラメータ効率の良いファインチューニング(PEFT)を採用し、音声と映像データを活用したマルチモーダル学習により、DFERの精度向上を目指す。具体的には、各エンコーダー層にMamba Fusion Adapter(MFAdapter)を挿入し、フレームアラインメントされたトークンシーケンス上で因果的な音声条件付き融合を実行することで、効率的なマルチレベルクロスモーダル注入を実現する。さらに、フレームレベル特徴配置(FFA)戦略により、音声トークルを映像フレームレートに合わせて配置し、因果的スキャンをサポートするフレームインデックス付き時間的プライアを提供。この手法により、モデルパラメータの2.7%(470万)のみを更新し、DFEWで76.62%/65.25%(WAR/UAR)、MAFWで最高の58.70%(WAR)という競争力のある性能を達成した。
- 動的顔表情認識(DFER)において、Mamba Fusion Adapterとフレームレベル特徴配置を採用し、モデルパラメータのわずか2.7%(470万)のみを更新するPEFT手法を提案。DFEWで76.62%/65.25%(WAR/UAR)、MAFWで58.70%(WAR)という性能を達成した。
パラメータ効率的ファインチューニングとマルチモーダル学習を組み合わせた顔表情認識技術の研究であり、AIモデル研究の進展として分類できる。ただし、特定企業の製品化や調達など投資判断を直接左右する具体的な事業事象は含まれておらず、学術的な性能向上の発表に留まる。