ビジョン言語モデル(VLM)の進化:昨年からの主要なトレンドと発展
Vision Language Models (Better, faster, stronger)
昨年4月以降、ビジョン言語モデル(VLM)は目覚ましい進化を遂げた。モデルは小型化しつつ高性能化し、推論、エージェンシー、長尺動画理解などの新機能が登場した。特に「Any-to-any」モデルは、画像、テキスト、音声など任意のモダリティを入力とし、任意のモダリティを出力できるようになった。MetaのChameleonやAlpha-VLLMのLumina-mGPT、そして最新のQwen 2.5 Omniなどがこの分野で注目されている。また、複雑な問題を解決する推論モデルも登場し、Kimi-VL-A3B-Thinkingなどがその例である。モデルの小型化も進み、消費者向けGPUで実行可能なSmolVLMやGemma 3-4B-itなどが開発されている。さらに、Mixture of Experts(MoE)アーキテクチャは、推論効率と性能向上に貢献しており、Kimi-VLやMoE-LLaVAなどがこのアプローチを採用している。ロボティクス分野では、Vision-language-action(VLA)モデルが登場し、Physical Intelligenceのπ0やNVIDIAのGR00T N1などがロボット制御に応用されている。ドキュメント理解においては、マルチモーダルRAGが進化し、マルチモーダルリトリーバーやColBERTライクなモデルが登場している。エージェンティックワークフローでは、UI操作やゲームプレイに対応するUI-TARS-1.5やMAGMA-8B、そしてsmolagentsライブラリが開発されている。動画理解においては、フレーム間の時間的関係性を考慮した様々なアプローチが研究されている。
本記事はVLM分野における複数の具体的な成果物(Chameleon、Lumina-mGPT、Qwen 2.5 Omni、Kimi-VL-A3B-Thinking、SmolVLM、Gemma 3-4B-it、π0、GR00T N1、UI-TARS-1.5、MAGMA-8Bなど)を列挙しているが、特定の企業発表、資金調達、受注、製品ローンチといった投資判断に直結する具体的な事象(日付・金額・契約など)は一切含まれていない。各モデルの機能やトレンドの紹介にとどまり、投資家がアクションを起こせるような事象情報がないため、out_of_scope とする。