LLMの入力コンテキストを精度低下なく16倍に圧縮する技術、研究チームが発表
Context compression finally works in production: new research cuts LLM input 16x without the accuracy hit
大規模言語モデル(LLM)のコンテキストウィンドウが計算上のボトルネックとなる中、NYU、コロンビア大学、プリンストン大学などの研究チームが、入力コンテキストをデコーダーに到達する前に圧縮する「Latent Context Language Models(LCLMs)」という新しい手法を発表した。この手法は、既存のKVキャッシュ圧縮とは異なり、デコーダー側での計算量とメモリ使用量を直接削減できる。論文によると、16倍圧縮時でRULERベンチマークにおいてKVキャッシュベースラインより8.8倍高速な出力を実現し、4倍圧縮時でも精度低下を3%未満に抑えた。LCLMsは、0.6Bエンコーダーと4Bデコーダーを組み合わせたアーキテクチャで、3500億トークン以上のデータで学習された。この技術はHuggingFaceでオープンソース化されており、既存のLLMやRAGシステムに統合可能だが、推論コスト、RAGパイプラインのチューニング、推論トレースのオンライン圧縮といった課題も存在する。
- NYU、コロンビア大学、プリンストン大学などの研究チームがLCLMを発表
- LCLMは入力コンテキストを16倍圧縮時、RULERベンチマークでKVキャッシュベースラインより8.8倍高速な出力を実現
- 4倍圧縮時では精度低下を3%未満に抑制
- LCLMはHuggingFaceでオープンソース化
LLMのコンテキストウィンドウ拡大に伴う計算コスト増大という根本課題に対し、デコーダー側の計算量を直接削減できるLCLMのアプローチは、従来のKVキャッシュ圧縮とは一線を画す。16倍圧縮時で8.8倍の高速化、4倍圧縮時で精度低下3%未満という性能は、RAGシステムや長文処理を要するLLMアプリケーションのコスト構造を大きく変え得る。NYU・コロンビア・プリンストンという有力アカデミアによる成果であり、HuggingFaceでオープンソース化されている点も、今後の業界標準化やスタートアップへの応用を加速させる可能性がある。投資家としては、この技術を統合するLLM基盤企業や、推論コスト低減が競争優位になるアプリケーション企業に注目したい。