LFM2.5-DSpark: H100からMacBookまで推論速度を最大3.2倍向上
Up to 3.2x Faster Inference with LFM2.5-DSpark
Liquid AIは、大規模言語モデル(LLM)の推論速度を向上させる技術「LFM2.5-DSpark」を発表しました。この技術は、推論のデコード段階におけるメモリ帯域幅のボトルネックを解消するために、軽量なドラフトモデルを用いて候補トークンを生成し、ターゲットモデルがそれを検証する「投機的デコーディング」を採用しています。DSparkは、並列バックボーン、逐次ヘッド、信頼度スケジューリングされた検証器の3つのコンポーネントを組み合わせます。LFM2.5-DSparkは、GPUでは最大3.18倍、オンデバイスでは最大2.87倍のスループット向上を実現し、特にLFM2.5-2.6Bモデルでは関数呼び出しのレイテンシを平均57%削減しました。llama.cppとSGLangとの連携もサポートし、関連するコードはオープンソース化されています。ドラフトモデルは、SFT、チャット、コード、関数呼び出しデータを含む多様なデータセットで学習され、約3億パラメータの比較的小さなモデルです。H100 GPUとM4 Max MacBook Proでのテスト結果も詳細に示されており、モデルサイズやデータセットによって速度向上の度合いは異なりますが、全体として顕著なパフォーマンス改善が見られます。
- Liquid AIがLLM推論速度を向上させる技術「LFM2.5-DSpark」を発表し、GPUで最大3.18倍、オンデバイスで最大2.87倍のスループット向上を実現
- LFM2.5-2.6Bモデルで関数呼び出しのレイテンシを平均57%削減
- 投機的デコーディングを採用し、約3億パラメータの軽量ドラフトモデルを使用
- llama.cppとSGLangとの連携をサポートし、関連コードをオープンソース化
- H100 GPUとM4 Max MacBook Proでのテスト結果を公開
Liquid AIがLLM推論のデコード段階におけるメモリ帯域幅ボトルネックを解消する投機的デコーディング技術「LFM2.5-DSpark」を発表した。GPUで最大3.18倍、オンデバイスで最大2.87倍のスループット向上を実現し、特にエッジ/オンデバイスAI推論の実用性向上に寄与する点が注目に値する。軽量ドラフトモデル(約3億パラメータ)を併用する方式で、llama.cppやSGLangとの連携、オープンソース化によりエコシステムへの浸透が見込まれる。LLM推論のコスト最適化・レイテンシ改善はAIインフラ投資の主要テーマであり、同社の技術的優位性と市場展開の進展を注視すべき。