動画事前知識と動的シーングラフに基づく長期間ロボット操作のための適応的タスク計画
Adaptive Task Planning for Long-Horizon Robotic Manipulation Based on Video Priors and Dynamic Scene Graphs
本研究は、ロボットが非構造化環境で複雑な長期間タスクを実行するための適応的タスク計画手法(ATP-VPDSG)を提案する。この手法は、事前学習済みVision-Language Models(VLMs)を利用して動画デモンストレーションから操作ロジックを抽出し、操作の事前知識を補強する。また、シーングラフを統合して非構造化環境を空間的・トポロジ的関係を持つ構造化表現に変換し、知覚の欠陥を補う。さらに、視覚的期待に基づくデュアルトラックフィードバック機構を組み込み、複雑な環境での失敗診断と適応的再計画を可能にする。LIBERO-10ベンチマークを用いた長期間ロボット操作実験では、Qwen3-VLをコアVLMとして使用し、ATP-VPDSGは平均タスク計画精度91.2%、タスク実行成功率74.67%を達成した。動画事前知識と動的シーングラフは、論理的制約と物理的実現可能性に対して相補的な効果を発揮することが確認された。さらに、産業用スライダー・レール組立タスクにおける実機実験では、タスク固有のファインチューニングなしで82.0%の成功率を達成し、シミュレーションから実機への転移に成功した。
- ATP-VPDSGはLIBERO-10ベンチマークで平均タスク計画精度91.2%、タスク実行成功率74.67%を達成
- 産業用スライダー・レール組立タスクの実機実験で、タスク固有のファインチューニングなしに82.0%の成功率を達成しsim-to-real転移に成功
本手法はロボットの長期間タスク計画におけるシミュレーションから実機への転移(sim-to-real)を、タスク固有のファインチューニングなしに達成した点が注目に値する。産業用組み立て工程での82.0%の成功率は、ロボットの実用化に向けた重要な進展を示しており、ロボットベンチャーや産業オートメーション分野での競争優位性につながる可能性がある。動画事前知識とシーングラフの組み合わせによる相補的効果は、汎用ロボット知能の実装アプローチとして投資判断の参考になる。