言語誘導型デュアルモードポリシーによる二腕操作
Language-Guided Dual-Mode Policy for Dual-Arm Manipulation
二腕ロボット操作タスクは複雑であり、同期協調と非同期逐次実行の2種類に大別される。既存の行動生成ポリシーは、これらのタスクタイプの時間的依存性や行動分布の違いを見落とし、モード間干渉を引き起こす単一ネットワークアーキテクチャを採用していた。この課題に対処するため、言語誘導型デュアルモードポリシーフレームワーク「LGDM」を提案する。LGDMは、共有言語埋め込みの下で、言語ルーティングと視覚認識のためのデュアル条件分岐を並列構築する。実行層は、ルーティング信号に従って独立した同期または非同期ポリシー分岐を選択し、知覚特徴と組み合わせて行動を出力することで、2つの運動モードを明示的に分離する。具体的には、言語埋め込みを中心とした3つの機能モジュールで構成される。(1)言語モードルーティング層:意味論の時間情報から運動モードを予測し、実行層にモード選択信号を提供する。(2)視覚認識層:FiLMを用いて意味情報を視覚バックボーンに注入し、タスク認識型の動的特徴変調を可能にする。(3)デュアルモード実行層:独立した同期および非同期ポリシー分岐を構築し、ルーティングに従って対応する分岐を選択し、変調された特徴で行動を生成する。6つの同期および非同期タスクで構成されるRoboTwin 2二腕操作ベンチマークにおいて、LGDMは既存のベースラインを上回り、RDTに対して絶対値で14.5パーセンテージポイントの改善を達成し、推論時に未知の時間協調命令バリアント下でも堅牢な実行性能を維持した。
- LGDMフレームワークがRoboTwin 2二腕操作ベンチマークで既存手法RDTを14.5パーセンテージポイント上回る精度を達成
- 未知の時間協調命令バリアント下でも推論時の堅牢な実行性能を維持
二腕ロボットの協調操作は産業用ロボットの重要課題であり、LGDMによるデュアルモードポリシーで同期・非同期タスク双方を扱える点は、複雑な実環境タスクへの適用可能性を示す。特にRoboTwin 2ベンチマークで既存手法RDTを14.5ポイント上回る精度向上は、同分野の競争優位性を示す具体的な成果であり、二腕ロボットの産業応用拡大に寄与する技術として投資観点で注目に値する。