SmolLM:驚異的な速度と卓越した性能を持つ最先端の小型言語モデルファミリー
SmolLM - blazingly fast and remarkably powerful
本記事では、最先端の小型言語モデルファミリーであるSmolLMを紹介する。SmolLMは135M、360M、1.7Bパラメータの3つのサイズで提供され、新しく高品質なデータセットで学習されている。データキュレーション、モデル評価、使用方法について詳述されている。SmolLM-Corpusは、Mixtralによって生成された合成教科書・物語集であるCosmopedia v2(28Bトークン)、The Stackからの教育用PythonサンプルであるPython-Edu(4Bトークン)、FineWebからの教育用WebサンプルであるFineWeb-Edu(220Bトークン)で構成される。評価の結果、SmolLMモデルは同サイズの他のモデルを、推論能力や世界知識に関する多様なベンチマークで上回ることが示された。特に、SmolLM-1.7Bは2Bパラメータ未満のモデルの中で最高の性能を示し、Pythonコーディング能力も高い。モデルはローカルデバイスでの実行に適しており、ONNXチェックポイントも提供される。
- Hugging Face が小規模言語モデルファミリー SmolLM(135M/360M/1.7B)を公開
- SmolLMモデルが同サイズの他モデルを各種ベンチマークで上回る性能を示した
- ONNXチェックポイントが提供されローカルデバイス実行が可能に
SmolLMは、小規模デバイス上で高性能なLLMを動作させるニーズに応えるモデルファミリーであり、135M〜1.7Bパラメータという軽量サイズで競合を凌ぐ推論性能・コーディング能力を実現している点が注目点。特に、ローカル推論やエッジAIへの需要拡大に伴い、同程度の小規模モデルを提供するスタートアップにとって競争環境の変化をもたらす可能性がある。また、高品質データセット(Cosmopedia v2, Python-Edu, FineWeb-Edu)による学習という差別化要素は、データキュレーション技術そのものへの投資関心にもつながる。