モーションプランニング拡張階層強化学習による長期間移動マニピュレーション
Motion Planning-Augmented Hierarchical Reinforcement Learning for Long-Horizon Mobile Manipulation
長期間の移動マニピュレーションは、屋内環境でのナビゲーション、ピッキング、関節オブジェクト操作などの異種サブタスクのシーケンス実行をロボットに要求する。標準的な強化学習は、この設定での報酬の疎性や非効率的な探索に苦しむ。階層的手法は、サブタスク間の引き継ぎがうまくいかないことが多い。本研究では、長期間移動マニピュレーションにおけるサンプル効率と引き継ぎ信頼性の根本的なトレードオフを解決するため、モーションプランニング拡張階層強化学習アーキテクチャを提案する。ミッションはSemi-Markov Decision Processによってサブタスクに分解され、各サブタスク内では、完全なジョイント設定空間でRRT*によって生成された衝突のない参照軌道が、ステップごとの形状信号として報酬に埋め込まれる。また、逆運動学の実現可能性から解析的に定義された領域ゴールメカニズムが、剛体座標の引き継ぎを連続的な実現可能領域に置き換える。このアーキテクチャは、ManiSkill-HABシミュレーションで、テレポートフリーのシーケンシャル実行と挑戦的な初期化の下で評価された。提案手法は、評価された6つのサブタスクすべてにおいて、ベースラインと比較してサブタスク成功率とサンプル効率を向上させ、その利点は長期間タスクチェーンに沿って複利で増加する。
- ManiSkill-HABシミュレーションで、提案手法が評価された6つのサブタスクすべてにおいてベースラインと比較してサブタスク成功率とサンプル効率を向上させた。
本稿で提案されたモーションプランニング拡張階層強化学習は、長期間の移動マニピュレーションにおけるサブタスク間の引き継ぎ信頼性とサンプル効率を同時に改善する技術であり、実用的なロボットの自律動作(家事・倉庫・医療など)の実現に向けた重要な進展。ただし現時点ではシミュレーション評価のみで、実機実証や製品化に至っていないため、投資判断にはさらなる実用化のマイルストーンを注視すべき。