FDMB-YOLOv11: 異なる照明条件下での交通警察官のコマンドジェスチャー認識手法
FDMB-YOLOv11: Traffic police command gesture recognition method under different lighting conditions
本論文では、異なる照明条件下での交通警察官のコマンドジェスチャー検出における誤検出、特徴表現の不足、リアルタイム性能の限界といった課題に対処するため、YOLOv11nアーキテクチャを基盤としたFDMB-YOLOv11モデルを提案する。Frequency Adaptive Dilated Convolution (FADC) を検出ヘッドに導入し、BiFormer注意機構をC2PSAモジュールに組み込んだ。バックボーンネットワークにはMobileNetV4を採用し、計算複雑性を低減した。また、Deformable Convolutionを用いて特徴表現能力を向上させた。実験の結果、FDMB-YOLOv11モデルは、通常の照明条件下で精度97.91%、再現率93.32%、mAP@0.5で97.17%を達成し、YOLOv11nモデルと比較してそれぞれ23.1%、13.63%、16.74%向上した。パラメータ数は258万から193万に削減され、軽量化が実現された。フレームレート(FPS)は65.789 fpsに低下したが、リアルタイム推論性能を維持し、エッジデバイスへの展開可能性を示した。本モデルは、SSD、Faster R-CNN、RTDETR、YOLOv12、YOLOv13といった他の検出アルゴリズムを上回り、最高のmAP@0.5を達成した。また、YOLOv11nモデルで見られた左折・右折ジェスチャーの誤分類問題も解決し、精度とパラメータ数のバランスを最適化した。
- YOLOv11nをベースにFADC、BiFormer、MobileNetV4、Deformable Convolutionを導入したFDMB-YOLOv11モデルを提案。通常照明下でmAP@0.5 97.17%を達成し、YOLOv11n比16.74%向上。
- パラメータ数を258万から193万に削減し軽量化を実現。FPSは65.789に低下するもリアルタイム推論性能を維持し、エッジデバイスへの展開可能性を示した。
本論文は交通警察官のジェスチャー認識という特定タスク向けのYOLOv11改良モデルであり、エッジデバイス展開を視野に入れた軽量化(パラメータ258万→193万)と精度向上を両立している点は注目に値する。ただし、研究段階の学術論文であり、商用化や具体的な事業化の発表はなく、投資判断に直結する企業・製品・調達情報は含まれない。