GARF: カメラとLiDARの情報を統合した極座標ベースの3D物体検出フレームワーク
3D Object Detection Based on Polar Representation for Better Comprehensive Performances
自動運転システムにおけるマルチモーダル3D物体検出タスクにおいて、既存のBEV(Bird's Eye View)融合手法はカルテジアン座標系をベースとしており、カメラとLiDARのセンシングジオメトリと完全に一致しないため、遠方領域で冗長な計算が発生するという課題があった。この課題に対処するため、本研究ではGARF(Geometry-Aware Polar BEV Framework)を提案する。GARFは、カメラとLiDARの特徴量を統一された極座標BEV空間に配置し、空間解像度をよりコンパクトに表現する。カメラブランチでは、極座標変換における不確実性ガイドにより深度推定の信頼性を向上させ、極座標BEV特徴量を洗練させてノイズと角度の不連続性を低減する。LiDARブランチでは、極座標を意識したスパース特徴抽出と歪み補正モジュールにより、極座標ボクセル化による異方性構造と幾何学的歪みに対処する。マルチモーダル融合では、領域を意識したクロスモーダル融合戦略と異方性ガウス中心応答マップを備えた極座標検出ヘッドにより、効果的な特徴量相互作用と一貫したジオメトリ監視を実現する。nuScenesデータセットでの実験の結果、GARFはmAP 71.8%、NDS 73.7%を達成し、ベースラインと比較してmAPで3.3%、NDSで2.3%向上した。また、推論速度は7.1 FPSから8.9 FPSに向上し、GPUメモリ消費量は41,114 MiBから33,346 MiBに減少した。
- GARFフレームワークがnuScenesデータセットでmAP 71.8%、NDS 73.7%を達成し、ベースライン比でmAP 3.3%、NDS 2.3%向上した
- 推論速度が7.1 FPSから8.9 FPSに向上し、GPUメモリ消費量が41,114 MiBから33,346 MiBに削減された
自動運転のマルチモーダル3D物体検出において、GARFフレームワークはnuScenesデータセットでmAP 71.8%、NDS 73.7%を達成し、ベースライン比でmAP 3.3ポイント、NDS 2.3ポイントの改善に加え、推論速度とGPUメモリ効率も向上させている。こうした技術進展は自動運転システムの安全性・性能・コスト効率に直結するため、モビリティ領域への投資判断に有用な情報である。