屋内シーンにおける単眼物体別距離推定のための統一評価プロトコルとレイトフュージョンシステム
A Unified Evaluation Protocol and Late-Fusion System for Monocular Per-Object Distance Estimation in Indoor Scenes
単眼物体別距離推定は、単一のRGB画像から検出された各物体に対してメートル単位の距離を予測する技術である。既存の手法は、領域選択、検出ソース、集約戦略の違いにより、手法間の比較可能性が制限されていた。本論文では、予測された距離と参照距離の両方を同じ予測バウンディングボックス内で計算する、統一されたデプロイメントに沿った評価プロトコルを提案する。この定式化により、関心領域の選択が標準化され、推論時にグラウンドトゥルースボックスへの依存が排除され、レイトフュージョン手法間の一貫した評価が可能になる。このフレームワークは、メトリック距離推定のためにカリキュラム学習されたDepth Anything V2 ViT-Sモデルと、物体局所化のためにYOLO11n検出器を統合している。SUN RGB-Dデータセットにおける同一ボックス評価プロトコル下で、Depth Anything V2 ViT-Sバックボーンは、平均集約を用いてMAE = 0.1286 m、RMSE = 0.1817 m、AbsRel = 0.0662、δ1 = 0.9785の物体別距離推定精度を達成した。バックボーンをViT-SからViT-Lにスケールアップすると、MAE = 0.1059 m、RMSE = 0.1484 m、AbsRel = 0.0553、δ1 = 0.9898に性能が向上し、ViT-Sと比較してMAEで約17.7%、RMSEで約18.3%の低下に相当する。これにより、同一ボックスプロトコル下での屋内物体別距離評価のための標準化された参照点が提供される。
- 同一ボックス評価プロトコル下で、Depth Anything V2 ViT-SバックボーンがMAE=0.1286m、RMSE=0.1817m、AbsRel=0.0662、δ1=0.9785の物体別距離推定精度を達成
- バックボーンをViT-SからViT-LにスケールアップするとMAE=0.1059m、RMSE=0.1484m、AbsRel=0.0553、δ1=0.9898に向上し、MAEで約17.7%、RMSEで約18.3%の改善
- YOLO11n検出器を用いた物体局所化とDepth Anything V2による距離推定を統合したレイトフュージョンシステムを提案
本論文は単眼物体別距離推定の評価プロトコル標準化と、Depth Anything V2 と YOLO11 を統合したレイトフュージョンシステムの性能を報告している。学術研究であり直接的な市場インパクトは限定的だが、Depth Anything V2 バックボーンのスケールアップによる精度向上(MAEで約17.7%改善)は、AIビジョン分野における基盤モデルスケーリングの有効性を示すデータとして注目に値する。ただし、特定企業の製品発表や資金調達など投資判断に直結する具体的な事象は含まれていない。