Apriel-H1: 効率的な推論モデルを蒸留するための驚くべき鍵
Apriel-H1: The Surprising Key to Distilling Efficient Reasoning Models
ServiceNowの研究チームは、既存の15B大規模言語モデルを再構築せずに効率化する手法「Apriel-H1」を発表しました。この手法は、蒸留プロセスにおいて、一般的な事前学習データではなく、教師モデルの高品質な推論データ(SFTデータ)を使用することに成功の鍵があることを発見しました。これにより、Apriel-H1-15b-Thinker-SFTモデルは、MATH500で0.90→0.92、MTBenchで8.30→8.58とわずかな品質低下に留めつつ、スループットを2.1倍向上させました。学習には合計76.8Bトークンが使用されました。モデルの効率化は、Mambaレイヤーを段階的に導入することで実現され、重要度の低いレイヤーから順に置き換えられました。この研究は、Fast-LLMというオープンソースのトレーニングフレームワーク上で構築され、再現性を重視しています。Apriel-H1はHugging Face TransformersおよびvLLMに統合されており、デプロイにはカスタムコードやフレームワークの制約への対応が必要となる可能性があるとされています。
- ServiceNowの研究チームが、大規模言語モデルを効率化する蒸留手法「Apriel-H1」を発表した
ServiceNowの研究チームが発表したApriel-H1は、大規模言語モデルの効率化(スループット2.1倍向上)を、性能低下を最小限に抑えながら実現する蒸留手法であり、推論モデルの実運用コスト削減に直結する。特に、高品質なSFTデータを用いた蒸留が鍵であるという発見は、今後のLLM運用においてデータ品質への投資が重要であることを示唆する。Fast-LLMフレームワーク上で構築され再現性が重視されている点も、エンタープライズAI導入を進める企業にとって評価すべきポイントである。