人間中心デジタルツインを用いた意図予測による応答性と説明可能なロボット支援のためのモジュラーフレームワーク
Modular Framework for Responsive and Explainable Robotic Assistance with Intention Prediction Using Human-Centric Digital Twins
人間とロボットの協働(HRC)における先回りしたロボット支援のため、タスク文脈の認識、ユーザーのニーズ予測、ワークフローを妨げない適切な介入を可能にするシステムが必要とされている。本稿では、大規模言語モデル(LLM)の推論と標準運用手順(SOP)による根拠付けを、意図、動作、知覚、音響、アフォーダンス、パフォーマンスの専門化されたモジュラー層と組み合わせたAgentic Unified Robotic Assistance(AURA)フレームワークを提案する。このフレームワークは、再トレーニングや再プロンプトなしで再構成可能かつ監査可能であり、中央の意思決定モジュールに構造化されたコンテキストを供給する。人間参加型の遠隔操作データ収集方法論と、先回りした介入タイミングに合わせた適切性スコア(A-Score)によるオフライン評価スキームを導入し、ワークスペースとロボットの手首カメラ映像、ロボットの関節状態、ラベル付けされた介入イベントを含む、注釈付きマルチモーダルHRCエピソードのベンチマークデータセットを公開する。3つの異なる複雑さのタスクにおいて、モジュールに豊かな根拠付けられたコンテキスト(過去の状態記憶と追跡されたオブジェクトの位置)が供給されるにつれて、意図予測と意思決定が段階的に向上し、コンテキストが乏しい条件とコンテキストが豊富な条件の間で複合F1スコアが20ポイント以上上昇することを確認した。構造化された根拠付けにより、Gemini 3.1 Flash Liteのような軽量なマルチモーダルバックボーンが、推論レイテンシ約5分の1で、より重い推論層モデルと同等の性能を発揮できる。これらの貢献により、協働環境における先回りしたロボット支援を進歩させるためのスケーラブルなフレームワーク、ベンチマーク、および評価方法論が確立される。
本論文は、人間とロボットの協働(HRC)においてLLMとSOPを組み合わせたモジュラーフレームワーク「AURA」を提案し、軽量モデルでも構造化コンテキストにより高精度な意図予測が可能であることを実証している。研究段階の成果であり、特定企業の製品化や事業インパクトを示す事象はないが、ロボットの「先回り支援」というテーマは産業応用上の関心領域であり、実用化段階の動向には引き続き注目したい。