SmolLM3: 小型・多言語対応・長文脈対応の推論モデル
SmolLM3: smol, multilingual, long-context reasoner
Hugging Faceは、30億パラメータ(3B)ながらLlama-3.2-3BやQwen2.5-3Bを上回り、4Bモデルにも匹敵する性能を持つSmolLM3を発表しました。11.2兆トークンで学習され、6言語(英語、フランス語、スペイン語、ドイツ語、イタリア語、ポルトガル語)に対応し、NoPEとYaRN技術により最大128kトークンの長文脈を扱えます。SmolLM3は、TransformerデコーダーアーキテクチャにGQA、NoPE、Intra-Document Masking、Embedding層のWeight Decay除去といった改良を加え、効率と長文脈性能を向上させています。学習は3段階で行われ、Web、コード、数学データを段階的に調整し、特に長文脈と推論能力向上のための中間学習ステージも設けられています。推論モードと非推論モードを切り替え可能なデュアルモードモデルとして、合成データ生成とAnchored Preference Optimization (APO) を用いて調整されました。モデルマージ技術により、推論能力向上による長文脈性能低下の問題を解決し、最大128kトークンでの性能を回復させています。評価では、多くのベンチマークで3Bモデルクラスのトップクラスの性能を示し、4Bモデルとも競争力のある結果を出しています。モデルコードはtransformers v4.53.0で利用可能であり、ツール呼び出し機能もサポートしています。
- Hugging FaceがSmolLM3を発表
- SmolLM3が11.2兆トークンで学習され、6言語対応、最大128kトークンの長文脈を処理可能に
Hugging Faceが発表したSmolLM3は、3BパラメータながらLlama-3.2-3BやQwen2.5-3Bを上回り、4Bモデルに匹敵する性能を示している。特に、小型モデルでありながら128kトークンの長文脈対応とツール呼び出し機能を備え、デュアルモード(推論/非推論)の切り替えが可能な点は、エッジデバイスやオンプレミス環境での軽量AIエージェント活用という実用的なユースケースを広げる。Hugging Faceのようなプラットフォーマーがオープンな小型高性能モデルを継続的にリリースすることで、AIモデルの民主化が加速し、大規模GPUクラスタに依存しないビジネスモデルや、プライバシー重視の業界(金融・医療等)でのAI導入が促進される可能性がある。投資家は、小型モデル市場での競争激化と、それに伴う推論コスト低減がAI産業全体の需要拡大につながる構図に注目すべき。