GazeHRNet: 頭部中心空間エンコーディングと視線認識特徴量相互作用による視線ターゲット検出
GazeHRNet: Head-Centric Spatial Encoding and Gaze-Aware Feature Interaction for Gaze Target Detection
RGB画像ベースの視線ターゲット検出において、従来の画像座標や補助的な幾何学的入力に頼る手法とは異なり、頭部中心の極座標エンコーディングと頭部認識アテンションルーティングを用いて視線ターゲットを検出するフレームワーク「GazeHRNet」を提案する。この手法は、視線対象を頭部との関連で解釈し、方向、距離、頭部とシーンの依存関係を統一的にモデル化する。粗い空間推論と細かいアニソトロピックヒートマップ予測を組み合わせることで、雑然としたシーンや様々な頭部位置でも信頼性の高いターゲット局在化を可能にする。GazeFollowとVideoAttentionTargetの実験では、RGB入力のみで0.952および0.929のAUCを達成し、学習パラメータ数は3Mである。クロスデータセット評価でも、異なるシーンや被験者分布に対する堅牢性と汎化性能の向上が示された。
- RGB画像のみで視線ターゲット検出を実現するフレームワーク「GazeHRNet」が提案された
- GazeFollowおよびVideoAttentionTargetデータセットでAUC 0.952および0.929を達成し、学習パラメータ数は3Mと軽量
本稿で紹介されたGazeHRNetは、RGB画像のみで高精度な視線ターゲット検出を実現する点が注目に値する。従来は深度情報や複数カメラが必要だったタスクを、わずか3Mパラメータの軽量モデルで0.95超のAUCを達成しており、省リソースかつ高精度な視線分析が可能になる。これはAR/VR、自動運転のドライバーモニタリング、リテールの購買行動分析など、視線情報を活用する幅広いアプリケーションにおいてコスト面・実装面の障壁を下げる可能性がある。ただし、提案段階の研究であり、商用化や実製品への応用には距離があることには留意が必要。