LFM2.5-Encoders: CPUでの高速な長文コンテキスト推論を実現
LFM2.5-Encoders for Fast Long-Context Inference on CPU
Liquid AIは、CPUで長文コンテキストの推論を高速に行える「LFM2.5-Encoders」を発表しました。このモデルは、GLUE、SuperGLUE、多言語タスクにおいて、より大きなエンコーダーと同等以上の性能を発揮し、8,192トークンのコンテキスト長をサポートしながら、入力が長くなってもレイテンシの増加が緩やかです。特にCPU上では、長文コンテキストにおいてModernBERT-baseと比較して約3.7倍高速に動作します。LFM2.5-Encodersは、LFM2アーキテクチャを基盤とし、双方向アテンションマスク、非因果的畳み込み、マスク言語モデリングといった手法でファインチューニングされており、分類、ルーティング、抽出、スコアリングなどの高頻度かつ低コストなNLPアプリケーションに適しています。モデルはLFM2.5-Encoder-230MとLFM2.5-Encoder-350Mの2サイズがあり、Hugging Faceで公開されています。
- Liquid AIがCPUで長文コンテキスト推論を高速に実行できるエンコーダーモデル「LFM2.5-Encoders」(230M/350Mパラメータ)を発表し、Hugging Faceで公開した。
- CPU上で長文コンテキストにおいてModernBERT-baseと比較して約3.7倍高速に動作する。
- 8,192トークンのコンテキスト長をサポートし、GLUE、SuperGLUE、多言語タスクでより大きなエンコーダーと同等以上の性能を達成した。
Liquid AIが発表したLFM2.5-Encodersは、CPU上での推論速度を大幅に改善することで、GPUリソースに依存しない低コストなNLPアプリケーションの実現可能性を示している。長文コンテキストでもレイテンシ増加が緩やかであり、分類・ルーティング・抽出・スコアリングといった高頻度処理に向いている点は、エッジデバイスやオンプレミス環境でのAI活用を促進する可能性がある。ModernBERT比3.7倍の高速化は、コスト構造の変革につながる数値であり、推論コストの低減が差別化要因となる市場において競争優位になり得る。投資家としては、同社の今後の展開や大手クラウド事業者との協業の有無、さらにはモデルの商用利用に関するライセンス動向を注視すべきである。