SmolVLMがさらに小型化 - 256Mおよび500Mモデルを発表
SmolVLM Grows Smaller – Introducing the 256M & 500M Models!
SmolVLMファミリーに、パラメータ数256MのSmolVLM-256Mと500MのSmolVLM-500Mの2つの新モデルが追加された。これらは世界最小クラスのビジョン言語モデル(VLM)であり、従来のSmolVLM 2Bで得られた知見を基に、効率性、データ混合、設計上のトレードオフに焦点を当てて開発された。これらのモデルは、トランスフォーマー、MLX、ONNXで直接ロード可能で、トランスフォーマーとWebGPU(ONNX経由)のデモも提供される。新モデルでは、より小型の93MパラメータのSigLIPベースパッチ-16/512ビジョンエンコーダーを採用し、画像解像度を向上させ、トークン化の最適化により学習効率と性能を高めている。特に256Mモデルは、そのサイズにもかかわらず、キャプション生成、ドキュメントQ&A、基本的な視覚的推論などのマルチモーダルタスクで高い性能を発揮する。500Mモデルは、より高いパフォーマンスと低メモリ使用量のバランスを提供し、DocVQAやMMMUタスクでより大きなモデルに近いスコアを達成する。これらのモデルは、リソースが制約されたデバイスやコンシューマー向けラップトップでの利用、あるいはブラウザベースの推論に適している。また、ColSmolVLMとして、マルチモーダル検索の速度と性能を向上させるためのファインチューニングも可能になっている。
- Hugging FaceがSmolVLM-256MおよびSmolVLM-500Mという2つの小型ビジョン言語モデルを発表・公開した
- 新モデルはトランスフォーマー、MLX、ONNXで直接ロード可能となり、WebGPUデモも提供された
Hugging FaceがSmolVLMシリーズを256M・500Mパラメータまで小型化したことは、エッジAIやブラウザベース推論の実用化を加速させる重要な進展。特に93Mパラメータの小型SigLIPビジョンエンコーダー採用やトークン化最適化により、リソース制約の強い環境でも実用的なマルチモーダル推論が可能になった点が注目。コンシューマー向けラップトップやWebGPU上での推論が現実的になり、エッジAI向け軽量モデル市場での競争が激化する可能性がある。投資家としては、軽量VLMの産業応用(ドキュメント処理、キャプション生成)への展開や、Hugging Faceのエコシステム強化によるプラットフォーム価値の向上に注目したい。