OpenLake: KVキャッシュオフロードでLLM推論コストを50%削減する分散オブジェクトストレージ
Show HN: Cuts Long Horizon Inference Costs by 50% via external KV Cache Offload
OpenLakeは、Rustとio_uringで構築されたAIインフラストラクチャ向けストレージエンジンで、GPUワークロード向けの分散オブジェクトストレージです。特にKVキャッシュオフロード機能により、PetabyteスケールのKVキャッシュストアをGPUホストに近接配置することでLLM推論コストを50%削減します。これにより、トレーニングや推論中のGPUアイドル時間を削減し、アクセラレータの利用効率を高めます。また、VectorDB、高速チェックポインティング、モデルトレーニング、コンテキストストレージなどの機能も提供します。OpenLakeはvLLMと統合可能で、既存のセットアップにコード変更なしで導入できます。RDMAやGPUDirect Storageに対応し、ゼロコピーでのデータ転送や、io_uringを活用した低レイテンシなI/O処理を実現します。ソースからのビルドや、S3互換ストレージのセットアップ手順も提供されています。
- OpenLakeはKVキャッシュオフロード機能によりLLM推論コストを50%削減すると発表
- PetabyteスケールのKVキャッシュストアをGPUホストに近接配置可能
- Rustとio_uringで構築された分散オブジェクトストレージ
- vLLMと統合可能でコード変更なしで導入可能
- RDMAやGPUDirect Storageに対応しゼロコピーデータ転送を実現
OpenLakeは、LLM推論のボトルネックであるKVキャッシュを分散オブジェクトストレージでオフロードし、コストを50%削減する点が注目に値する。GPUメモリの高価格が課題となるAIインフラ領域において、Rustとio_uringによる高効率ストレージエンジンでPetabyte規模のキャッシュを低レイテンシで扱える点は、vLLMとの統合によりコード変更不要で導入可能なため、実用性が高い。AI推論のコスト構造を変える可能性がある技術であり、AI向けストレージインフラの新たな市場を開拓するポテンシャルを持つ。