NVIDIA、物理AI推論・行動のための初のオープンオムニモデル「Cosmos 3」を発表
Welcome NVIDIA Cosmos 3: The First Open Omni-model for Physical AI Reasoning and Action
NVIDIAは、ロボティクス、自動運転車、スマートスペース向けに物理世界をシミュレーション・理解するための基盤となる「Cosmos 3」を発表しました。Cosmos 3は、複数の機能を単一モデルに統合したオムニモデルであり、Mixture-of-Transformers (MoT) アーキテクチャに基づいています。これにより、テキスト、画像、動画、音声、行動といった複数のモダリティを単一のモデルで処理し、推論と生成を同時に行うことが可能になりました。モデルは160億パラメータの「Cosmos 3 Nano」と640億パラメータの「Cosmos 3 Super」の2サイズがあり、Hugging Faceで提供されます。また、物理AIコミュニティのトレーニングと評価を支援するため、Embodied-Robot-Scenes、Physical-Interaction-Scenesなどの合成データ生成(SDG)データセットも公開されました。Cosmos 3は、Hugging Face Diffusersライブラリとも統合されており、既存のパイプラインとの連携が容易になっています。
- NVIDIAが物理AI向けオムニモデル「Cosmos 3」を発表
- 合成データ生成データセット(Embodied-Robot-Scenes, Physical-Interaction-Scenes)を公開
NVIDIAが物理AI領域で初のオープンなオムニモデル「Cosmos 3」を公開した点は注目に値する。単なる大規模言語モデルではなく、ロボティクスや自動運転といった物理世界の推論・行動を扱う領域で、NVIDIAが自社のGPUエコシステムだけでなく、Hugging FaceやDiffusersといった既存の開発パイプラインと統合したオープンな基盤モデルを提供することで、物理AI分野の標準プラットフォームを狙っている。160億・640億パラメータの2サイズ展開と合成データセットの同時公開は、スタートアップや研究機関の参入障壁を引き下げ、NVIDIAのGPU需要をさらに拡大させる戦略と言える。