Hugging Face、SOTA(State-of-the-Art)なMixtral(Mixture of Experts)モデルをリリース
Welcome Mixtral - a SOTA Mixture of Experts on Hugging Face
Hugging Faceは、Mixtral-8x7Bという新しいMixture of Experts(MoE)モデルを発表しました。このモデルは、8つの「エキスパート」モデルを組み合わせたアーキテクチャを持ち、一部のフィードフォワード層をスパースなMoE層に置き換えています。各トークン処理時に2つのエキスパートが選択され、12Bパラメータ密モデルと同等のデコード速度で、実質4倍のパラメータ数を持つことができます。Mixtral-8x7Bは、Llama 2 70Bを上回り、多くのベンチマークでGPT-3.5に匹敵または凌駕する性能を示します。また、Apache 2.0ライセンスで商用利用が可能であり、32kトークンのコンテキスト長をサポートします。推論には約90GBのVRAM(float16)、4ビット量子化で約23GBが必要です。Hugging Faceのエコシステム(Transformers、Inference Endpoints、Text Generation Inference)との統合も提供され、単一GPUでのファインチューニングや、QLoRA、GPTQなどの量子化手法によるメモリ使用量の削減も可能です。
- Hugging FaceがMixtral-8x7BというMixture of Expertsモデルをリリース
Hugging FaceがMixtral-8x7Bをリリースしたことは、オープンなMoEモデルが商用利用可能な形で登場した点で注目に値する。Llama 2 70Bを上回りGPT-3.5に匹敵する性能を、より少ないパラメータで実現しており、推論コストの大幅な低下につながる。またApache 2.0ライセンスで商用利用が可能なため、エンタープライズ領域でのLLM活用が加速する可能性がある。Hugging Faceのエコシステムに統合されている点も、導入障壁を下げる要因として重要。