Hugging Face TransformersをAWS Inferentia2で高速化
Accelerating Hugging Face Transformers with AWS Inferentia2
Hugging Faceは、AWS Inferentia2を使用してHugging Face Transformersモデルの最適化を発表しました。Inferentia2は、前世代のInferentiaと比較してスループットが4倍、レイテンシが10分の1に向上し、NVIDIA A10G GPUと比較しても大幅な性能向上を実現します。新しいAmazon EC2 Inf2インスタンスは、最大12個のInferentia2チップを搭載し、大規模モデルの分散推論に対応します。AWS Neuron SDKとのネイティブ統合により、モデルのコンパイルは1行のコードで完了します。BERT、RoBERTa、DistilBERT、Vision Transformersなどのモデルを用いたベンチマークでは、Inferentia2はNVIDIA A10G GPUと比較して平均4.5倍、Inferentia1インスタンスと比較して4倍のレイテンシ改善を示しました。これにより、開発者は複雑な最適化なしに、高性能な機械学習モデルを低コストで利用できるようになります。
- Hugging FaceがAWS Inferentia2向けにTransformersモデルの最適化を発表
Hugging FaceとAWSが協業してTransformersモデルをInferentia2で最適化したことは、AI推論のコスト構造に大きな影響を与える。NVIDIA A10G比で平均4.5倍のレイテンシ改善は、GPU依存度が高いAIワークロードにおいて、カスタムASIC(Inferentia)が現実的な代替手段となりつつあることを示す。AWSが自社シリコンで推論の価格性能比を押し上げれば、NVIDIAの推論市場シェア低下や、クラウド顧客のマルチアーキテクチャ戦略加速につながる可能性がある。特にBERTやVision Transformersといった実用的なモデルでベンチマークが取られている点は、導入障壁の低さを示しており、中長期的にはAI推論におけるハードウェア多様化の流れを後押しする。