NVIDIA Nemotron 3 Nano Omni: ドキュメント、音声、ビデオエージェント向け長文脈マルチモーダルインテリジェンス
Introducing NVIDIA Nemotron 3 Nano Omni: Long-Context Multimodal Intelligence for Documents, Audio and Video Agents
NVIDIAは、ドキュメント、音声、ビデオを統合的に理解する新モデル「Nemotron 3 Nano Omni」を発表しました。このモデルは、従来の視覚言語モデルを拡張し、テキスト、画像、ビデオ、音声に対応するマルチモーダルモデルです。MMlongbench-Doc、OCRBenchV2、WorldSense、DailyOmni、VoiceBenchなどの複雑なベンチマークで最高クラスの精度を達成し、コスト効率にも優れています。アーキテクチャは、Mamba-Transformer Mixture-of-Expertsバックボーンに、C-RADIOv4-HビジョンエンコーダーとParakeet-TDT-0.6B-v2オーディオエンコーダーを組み合わせています。これにより、高解像度の画像やドキュメント、長時間の音声・ビデオコンテキストを処理し、詳細な情報を保持しながらネイティブな音声理解とマルチモーダル推論が可能です。処理スループットは最大9倍、推論速度は2.9倍向上しています。HuggingFaceでBF16、FP8、NVFP4のチェックポイントが公開されています。
- NVIDIAがマルチモーダルモデル「Nemotron 3 Nano Omni」を発表し、HuggingFaceでチェックポイントを公開
NVIDIAがマルチモーダル対応の小型モデルNemotron 3 Nano Omniを発表した。注目点は、(1) Mamba-Transformer MoEという新しいアーキテクチャ採用による推論速度2.9倍・スループット9倍の効率性、(2) テキスト・画像・音声・ビデオを統合処理するマルチモーダル性能で複数ベンチマーク最高精度、(3) BF16/FP8/NVFP4の量子化チェックポイントがHuggingFaceで公開され、エッジやオンデバイス展開が容易なこと。NVIDIAのAIモデル戦略が超大規模LLMだけでなく、軽量・高性能なオンデバイス/エッジ向け小型モデルにも広がっている点が投資上重要。同社のAIプラットフォームの裾野拡大と、推論効率競争での優位性強化を示唆する。