AirLLM、4GB GPUで70B大規模言語モデルの推論を実現
AirLLM 70B inference with single 4GB GPU
AirLLMは、推論時のメモリ使用量を大幅に削減し、量子化、蒸留、プルーニングなしで70B大規模言語モデルを単一の4GB GPUカードで実行可能にする技術です。この技術により、405B Llama 3.1は8GB、DeepSeek-V3 (671B)は12GB、Kimi K3 (2.8T)は4GB未満のGPUで動作します。これは、スパースMoEモデルがレイヤー全体ではなく一度に一つのエキスパートをストリーミングするためです。特に、Kimi K3 (2.8T)は2026年7月に単一カードで3.72GBのVRAMで動作可能になりました。また、v3.0ではFP8モデルサポートが追加され、DeepSeek-V3 (671B)は約12GB、Qwen3-235Bは約3GBで実行できます。過去のアップデートでは、CPU推論、非シャーディングモデル、Llama3.1 405B、8bit/4bit量子化、macOSでの実行、AutoModelによるモデルタイプの自動検出、レイヤー分割モデルのプリフェッチングによる速度向上などがサポートされています。AirLLMは、Llama、Qwen、DeepSeek、Mistral、Phi、Gemma、ChatGLMなど、ほぼ全ての人気オープンLLMに対応しています。
- AirLLMが量子化・蒸留・プルーニングなしで70B LLMを単一4GB GPUで実行可能にする技術を発表
- DeepSeek-V3 (671B)を約12GB VRAM、Qwen3-235Bを約3GB VRAMで実行可能に(v3.0でFP8サポート追加)
- Kimi K3 (2.8Tパラメータ)が2026年7月に単一カード3.72GB VRAMで動作可能になった
- 405B Llama 3.1は8GB GPUで動作可能
エッジ/低リソース環境での大規模LLM推論を可能にする技術であり、GPUリソースが限られた環境でのAI導入コストを大幅に削減する可能性がある。特に、量子化や蒸留なしで70Bモデルを4GB GPUで実行できる点は、AIインフラ投資の分散化やエッジAI市場の拡大につながるため、AI半導体やクラウドサービス事業者への影響を注視すべき。