STAMP: ゼロショット連続ビジョン&言語ナビゲーションのための空間時間アンカー付きモーションプランニング
STAMP: Spatial-Temporal Anchored Motion Planning for Zero-Shot Continuous Vision-and-Language Navigation
連続環境におけるビジョン&言語ナビゲーション(VLN-CE)は、具現化されたエージェントが自然言語の指示を信頼性の高い長期間の動作決定に落とし込む必要がある。この課題に対し、STAMP(Spatial-Temporal Anchored Motion Planning)フレームワークが提案された。STAMPは、事前学習済み世界知識と具現化されたナビゲーションのギャップを体系的に埋める。階層設計を採用し、高レベルのセマンティック推論と低レベルの動作実行を分離することで、凍結されたLVLM(Multimodal Large Language Model)が構造化されたナビゲーション指向の抽象化上で動作することを可能にする。中核的な新規性は、指示関連のランドマーク、アクションの意味論、深度認識ジオメトリ、ナビゲーション履歴コンテキストを明示的にエンコードするマルチモーダル空間時間アンカー機構と、決定をナビゲーションクリティカルな手がかりに制約するChain-of-Navigation推論プロセスにある。さらに、STAMPはオンラインでバックトラッキング可能なトポロジカルマップを段階的に構築し、不確実性下での堅牢な計画をサポートする。実験の結果、STAMPはVLN-CEベンチマークおよび実世界設定において、最先端のゼロショット手法に匹敵する性能を達成した。
- STAMPフレームワークが発表され、VLN-CEベンチマークおよび実世界設定において最先端のゼロショット手法に匹敵する性能を達成した
本記事で紹介されたSTAMPフレームワークは、VLN-CE(連続環境ビジョン&言語ナビゲーション)において、マルチモーダル大規模言語モデル(LVLM)を活用し、ゼロショットで高精度なナビゲーションを実現する点が注目に値する。特に「空間時間アンカー機構」と「Chain-of-Navigation推論」により、従来困難だった長期間の動作決定を構造化した点は、具現化AIエージェントの実用化に大きく寄与する。実世界設定でも競争力のある性能を示しており、ロボティクスや自動運転などへの応用可能性を広げる技術基盤として、関連スタートアップや大手テクノロジー企業の動向を注視すべきである。