トップビュークレーン安全監視のためのターゲット認識型デカップリングメトリック深度推定
Target-Aware Decoupled Metric-Depth Estimation for Top-View Crane Safety Surveillance
トップビューのクレーンカメラからの安全関連ターゲットのメトリック深度推定は、単眼予測がスケール曖昧であり、関心領域(RoI)がペイロード、人員、吊りワイヤー、地面からのリターンを混在させるため困難である。本研究では、検出器がRoIを定義し、密なメトリック深度マップを予測し、オブジェクトごとに代表的な深度を1つ抽出するターゲット中心のパイプラインを提案する。DINOv2–DPT相対深度ネットワークは固定され、マルチスケールアダプター、DINO検出分岐、ピクセルごとの空間アフィンキャリブレーションヘッドが訓練される。グラウンドトゥルースバウンディングボックスは、ターゲット関連領域へのメトリック監視を制限するが、キャリブレーションヘッドへの入力ではない。評価では、すべての深度手法は同一の予測RoIを使用し、クラス認識カーネル密度推定ルールが代表深度を抽出する。1台の運用中の150トンクレーンからの272フレームのハードウェア同期RGB-LiDARフレームにおいて、提案手法はターゲットレベルRMSE 0.564 m、ピクセルレベルインライア比 0.966 (δ<1.25) を達成した。1対1のグラウンドトゥルースマッチングは、検出精度/再現率 0.960/0.970 で 0.566 m のターゲットRMSEを yielded した。AdaBins はより低いピクセルレベルMAEとRMSEを達成したが、提案手法はより低いターゲットレベルエラーを達成した。これらの結果は、評価された運用クレーン条件下でのターゲット中心メトリックレンジングの実現可能性を示している。
- DINOv2–DPT相対深度ネットワークを固定し、マルチスケールアダプター・DINO検出分岐・ピクセル単位の空間アフィンキャリブレーションヘッドを学習するターゲット中心パイプラインを提案
- 運用中の150トンクレーンから取得した272フレームのハードウェア同期RGB-LiDARデータで、ターゲットレベルRMSE 0.564 m、ピクセルレベルインライア比 0.966 (δ<1.25) を達成
- 1対1のグラウンドトゥルースマッチングで検出精度/再現率 0.960/0.970、ターゲットRMSE 0.566 m を記録
- 比較手法AdaBinsはピクセルレベルMAE/RMSEで優位だったが、ターゲットレベル誤差は提案手法が上回った
単眼RGBからのメトリック深度推定を「ターゲット中心」に再設計し、運用中の150トン実機クレーンで対象レベルRMSE 0.564m・インライア比0.966を達成した点が注目点。固定したDINOv2ベースの相対深度ネットワークにマルチスケールアダプタ、検出分岐、空間アフィンキャリブレーションヘッドを追加学習する構成で、既存の事前学習モデルを活用しつつ産業用途のスケール精度を引き上げるアプローチは、産業用AI・建設機械の安全監視・ロボティクス向け知覚ソフトの実装コストを下げる方向に働く。投資家としては、汎用深度基盤モデルの産業特化ファインチューニングが実機精度に到達した証拠として、産業AIソリューションの商用化余地と、クレーン・建設・物流向け安全監視市場への展開可能性を評価したい。