Rotary GPU: 限られたVRAMで大規模MoEモデルのローカル実行を探る
Rotary GPU: Exploring Local Execution for Large MoE Models Under Limited VRAM
本稿では、既存の大規模言語モデルを、より少ないハードウェアリソースを持つ環境で利用可能にするための実行アプローチ「Rotary GPU」を提案する。これは、アクセラレータの常駐化に関する先行研究に基づいた探索的なアプローチである。Qwen3.6-35B-A3BクラスのMixture-of-Expertsモデルを、8GB VRAMを搭載したコンシューマー向けラップトップ(RTX 4060 Laptop GPU)でローカル実行する検証が行われた。主な設定では、2048トークンを生成し、VRAM使用量は約6.3GB、デコードスループットは21.06トークン/秒を維持した。本研究の目的は、データセンターインフラストラクチャを置き換えることではなく、大規模モデルの能力の一部を、そのようなインフラが利用できない環境に近づける可能性を探ることにある。
- 8GB VRAMのRTX 4060 Laptop GPU上でQwen3.6-35B-A3B MoEモデルをローカル実行し、21.06トークン/秒のデコードスループットを達成した
本稿は、限られたVRAM(8GB)のコンシューマー向けGPUで大規模MoEモデル(Qwen3.6-35B-A3B)を実用的な速度(21トークン/秒)でローカル実行できる「Rotary GPU」アプローチを検証した探索的な研究である。投資家視点では、エッジ/ローカルLLM推論の実用性が高まることで、データセンター依存の推論から分散型実行へのシフトが加速する可能性がある点に注目したい。特に、コンシューマーGPU市場(NVIDIA RTX 40xxシリーズなど)の需要がAIワークロードによりさらに拡大する余地を示唆する。とはいえ本稿は学術的な実証実験であり、商用化や製品発表には至っていないため、現時点での直接的な投資インパクトは限定的である。