768GBのIntel Optane DIMMで単一GPUで1兆パラメータLLMを4tpsで実行
768GB Intel Optane DIMMs to run 1T-parameter LLM with single GPU at 4tps
あるRedditorが、Intel Optane Persistent Memory (PMem) DIMMをRAMとして使用したワークステーションで、1兆パラメータのLLMをローカルで約4トークン/秒で実行させることに成功した。この構成では、中古で安価に入手した6枚の128GB Optane DIMM(合計768GB)を使用し、DRAMをキャッシュとして設定した。CPUはIntel Xeon Gold 6246、GPUはAsus Dual GeForce RTX 3060 OC 12GB。ソフトウェアはKimi K2.5モデルを使用し、llama.cppによるハイブリッドGPU/CPU推論手法と、'override-tensor'フラグを用いてテンソルを12GB GPUに収容する最適化を行った。この構成は、限られたハードウェア予算で最先端の1兆パラメータモデルを実行した成功例として評価されている。Optane製品の市場投入中止は惜しまれるが、DRAMとSSDの間のメモリ製品の需要、特にLLMワークロード向けには、CXL (Compute Express Link) 標準などが将来的にこのギャップを埋める可能性があると示唆されている。
- Redditユーザーが6枚の128GB Intel Optane PMem DIMM(合計768GB)を用い、1兆パラメータLLM(Kimi K2.5)を約4トークン/秒でローカル実行することに成功
Redditユーザーが中古のIntel Optane PMem DIMM(768GB、約4万円相当)とRTX 3060という低予算構成で1兆パラメータLLMをローカル実行した事例。ポイントは、(1) メモリ階層の革新(PMemをRAMとして活用)が巨大モデルの推論を民主化しうること、(2) CXL標準がOptane撤退後のギャップを埋める可能性があること、(3) llama.cppのhybrid GPU/CPU推論+override-tensor最適化が実運用レベルに達していること。投資家は、LLM推論のメモリ帯域・容量ボトルネックを解消する技術(CXLメモリ展開、PMem代替、メモリプーリング)への注目と、ローカル実行ニーズの高まりによるエッジ/クライアントAI向けハードウェア市場の拡大に着目すべき。