bitsandbytes、4ビット量子化、QLoRAによるLLMのアクセシビリティ向上
Making LLMs even more accessible with bitsandbytes, 4-bit quantization and QLoRA
Hugging Faceは、bitsandbytesライブラリと協力し、4ビット精度でのモデル実行を可能にする新しい手法「QLoRA」を発表しました。QLoRAは、メモリ使用量を大幅に削減し、65Bパラメータモデルを単一の48GB GPUでファインチューニング可能にしつつ、16ビットファインチューニングと同等の性能を維持します。この手法は、4ビット正規化フロート(NF4)、ダブル量子化、ページオプティマイザなどのイノベーションを取り入れています。QLoRAにより、1,000以上のモデルがファインチューニングされ、GuanacoモデルはVicunaベンチマークでChatGPTの99.3%の性能を達成しました。記事では、4ビット量子化モデルのロード方法、NF4やダブル量子化、計算データ型(bfloat16など)の設定方法、およびCPUでは実行できないがCUDA 11.2以降を搭載したGPUであれば利用可能であることが説明されています。また、Llama、OPT、GPT-NeoXなどの多くのモデルアーキテクチャがサポートされており、パラメータ効率の良いファインチューニング(PEFT)手法と組み合わせることで、アダプターのトレーニングなどが可能になります。ベンチマーク結果も示されており、コンシューマー向けハードウェアでの大規模モデルのファインチューニングにおけるメモリ使用量の削減効果が実証されています。
- Hugging Faceがbitsandbytesライブラリと協力し、4ビット量子化手法QLoRAを発表
- QLoRAにより65Bパラメータモデルを単一の48GB GPUでファインチューニング可能に
- QLoRAでファインチューニングされたGuanacoモデルがVicunaベンチマークでChatGPTの99.3%の性能を達成
QLoRAは、4ビット量子化により巨大LLMのファインチューニングに必要なGPUメモリを劇的に削減し、コンシューマー向けハードウェアでも65Bパラメータモデルの学習を可能にした点が重要。この技術は、LLMの民主化と普及を加速し、AIモデルのファインチューニングを大規模クラウドからエッジ・個人レベルにシフトさせる可能性がある。Hugging Faceがbitsandbytesと協力してこれを実現したことで、同社のAIエコシステムにおけるプラットフォーム価値がさらに高まっている。投資家としては、LLM推論・学習のコスト削減がAIアプリケーションの収益性と普及速度に与える影響に注目すべき。