TransformersにおけるMixture of Experts (MoEs)の進化
Mixture of Experts (MoEs) in Transformers
大規模言語モデル(LLM)の進化は、パラメータ数の増加とデータ量の拡大によって牽引されてきたが、計算コスト、推論遅延、メモリ要件といった課題に直面している。この課題を解決するため、Mixture of Experts (MoEs) モデルが注目されている。MoEsは、Transformerの密なフィードフォワード層を、トークンごとにルーティングされる複数の「エキスパート」と呼ばれるサブネットワークに置き換える。これにより、モデル全体のパラメータ数は巨大でも、推論時にアクティブになるパラメータ数を抑えることで、計算効率と推論速度を大幅に向上させることができる。例えば、gpt-oss-20bは21Bの総パラメータ数を持つが、アクティブなパラメータ数は約3.6Bに留まり、高速な推論を実現している。Hugging Faceのtransformersライブラリは、MoEsを第一級市民としてサポートするために、モデルのロード、実行、分散処理のパイプラインを刷新した。具体的には、チェックポイントで個別に保存されているエキスパートの重みを、実行時には単一の連続したテンソルにパックするWeightConverterを導入し、動的な重みロードを実現した。また、エキスパート間の計算を効率化するために、eager、batched_mm、grouped_mmといったエキスパートバックエンドシステムが開発された。さらに、エキスパートを複数のデバイスに分散させるエキスパート並列(EP)もサポートされ、超大規模モデルのトレーニングを可能にする。Unslothとの連携により、MoEモデルのトレーニング速度も大幅に向上している。
- Hugging FaceがtransformersライブラリでMoEモデルを第一級市民としてサポートするための刷新を発表。WeightConverterやエキスパート並列(EP)などの新機能を導入。
- Unslothとの連携によりMoEモデルのトレーニング速度が大幅に向上。
Hugging FaceによるMoE対応のtransformersライブラリ刷新は、LLMの計算効率と推論速度を大幅に改善する基盤技術の進展であり、AIインフラのデファクトスタンダードであるHugging Faceのエコシステム強化に直結する。gpt-oss-20bのように総パラメータ21Bに対してアクティブパラメータを3.6Bに抑える設計は、推論コスト削減とスループット向上を同時に実現するため、AIサービスを運用する企業にとって競争力の源泉となる。WeightConverterやエキスパート並列(EP)といった具体的な実装改善は、大規模モデルのトレーニング・推論の民主化を加速し、AI業界全体のバリューチェーンに影響を与える。