SmolVLA: 450Mパラメータのオープンソースロボティクス用Vision-Language-Actionモデル、消費者向けハードウェアで動作
SmolVLA: Efficient Vision-Language-Action Model trained on Lerobot Community Data
SmolVLAは、4億5000万パラメータを持つコンパクトでオープンソースのVision-Language-Action (VLA) モデルで、消費者向けハードウェアで動作します。Lerobotコミュニティが共有するライセンス互換のオープンソースデータセットのみで事前学習されており、シミュレーション(LIBERO, Meta-World)および実世界タスク(SO100, SO101)において、より大規模なVLAモデルやACTなどのベースラインを上回る性能を示します。非同期推論をサポートし、応答速度を30%向上させ、タスクスループットを2倍にします。このモデルは、Transformerとフローマッチングデコーダーを組み合わせ、推論速度と低遅延のために最適化されています。具体的には、ビジョンモデルのレイヤーをスキップし、アテンションブロックをインターリーブさせ、ビジュアルトークン数を削減し、小型の事前学習済みVLMを活用しています。また、非同期推論スタックは、ロボットの行動実行と推論を分離することで、応答性を高め、実行ラグをなくします。SmolVLAは、コミュニティ提供の多様なデータセットを活用し、ロボティクス分野における再現性とアクセシビリティの向上を目指しています。
- SmolVLAという450MパラメータのオープンソースVision-Language-Actionモデルが公開され、消費者向けハードウェアで動作可能であることが発表された。
- SmolVLAがシミュレーションおよび実世界タスクにおいて、より大規模なVLAモデルやACTなどのベースラインを上回る性能を示した。
SmolVLAは、4.5億パラメータという軽量なVLAモデルでありながら、消費者向けハードウェアで動作し、大規模モデルを凌ぐ性能を示した点が重要。非同期推論による応答速度向上(30%改善、タスクスループット2倍)は、実用的なロボットへのVLA搭載の敷居を大幅に下げる。オープンソースかつLerobotコミュニティのデータのみで事前学習されているため、再現性が高く、ロボティクス領域におけるアクセシビリティ向上と民主化に貢献する。投資家視点では、小型モデルで高性能を実現するアプローチは、エッジロボティクスや家庭用ロボットへの展開を加速させる可能性があり、関連スタートアップや周辺技術(フローマッチング、非同期推論スタック)への注目が高まる。