MolmoMotion: 言語誘導による3D動作予測モデル
MolmoMotion: Language-guided 3D motion forecasting
MolmoMotionは、与えられた動画フレーム、オブジェクト上の3Dポイント、および意図されたアクションを記述するテキスト指示に基づいて、今後数秒間のポイントの3D空間における動きを予測する新しいモーション予測モデルである。既存の手法よりも大幅に優れた性能を発揮する。このモデルは、ロボット工学の計画や軌道条件付きビデオ生成などの下流アプリケーションを駆動するために使用できる。また、MolmoMotion-1Mという、アクション記述とペアになった3Dポイント軌道の最大のコレクション(116万ビデオから抽出)と、オブジェクト中心の3Dモーション予測精度を測定するために設計された人間検証済みのベンチマークであるPointMotionBench(2.7Kビデオクリップを含む)も公開されている。MolmoMotionは、クラス非依存、視点安定、下流システムで直接使用可能という3つの特性を持つオブジェクト付着3Dポイントとしてモーションを表現する。モデルは、自動アノテーションパイプラインによって生成された大規模データセットでトレーニングされており、ロボット計画やビデオ生成などのタスクでその有効性が実証されている。特に、ロボット工学においては、MolmoMotionを基盤とした制御ポリシーは、従来のモデルと比較してピックアンドプレースタスクの成功率と学習速度を向上させる。ビデオ生成においては、MolmoMotionの予測を利用することで、生成されるビデオが指示されたアクションにより忠実に従うようになる。
- MolmoMotionは、テキスト指示に基づき3D空間上のポイントの動きを予測する新しいモーション予測モデルで、既存手法より大幅に優れた性能を達成した
- MolmoMotion-1Mデータセット(116万ビデオから抽出した3Dポイント軌道)とPointMotionBenchベンチマーク(2.7Kビデオクリップ)が公開された
- ロボット工学において、MolmoMotionを基盤とした制御ポリシーがピックアンドプレースタスクの成功率と学習速度を向上させた
MolmoMotionは、テキスト指示から3D空間上のオブジェクトの動きを高精度に予測する初の大規模モデルであり、ロボット工学(ピックアンドプレース成功率・学習速度の向上)とビデオ生成(指示追従性向上)という2つの応用領域で実証済みである点が重要。特にロボット制御への応用は産業オートメーションの効率化に直結し、MolmoMotion-1MデータセットとPointMotionBenchベンチマークの公開により、当該領域の研究開発を加速するエコシステムが形成されつつある。投資家としては、同技術がロボットタスク計画と映像生成の両市場に波及する可能性と、データセットの公開によって競合が増えるリスクの両面を注視すべき。