Hugging Face、AWS Inferentia2へのモデルデプロイを簡素化
Deploy models on AWS Inferentia2 from Hugging Face
Hugging Faceは、AWS Inferentia2チップを活用してモデルをデプロイする新機能とインスタンスを発表しました。これにより、Hugging Face Hub上の10万以上の公開モデルが、Amazon EC2 Inf2インスタンス上で容易に利用可能になります。特に、SageMakerやHugging Face Inference Endpointsを通じて、14の新しいモデルアーキテクチャと6つの機械学習タスクに対応し、大規模言語モデル(LLM)の推論を低コストかつ高性能で実行できるようになります。例えば、Llama 3 8BモデルはInf2-smallインスタンス(0.75ドル/時)、Llama 3 70BモデルはInf2-xlargeインスタンス(12ドル/時)でデプロイ可能です。Hugging Face Inference Endpointsは、Text Generation Inference (TGI) for Neuronを利用し、OpenAI SDK Messages APIとの互換性も備えています。今後は、DiffusionモデルやEmbeddingモデルへの対応も予定されています。
- Hugging FaceがAWS Inferentia2向けのモデルデプロイ機能とインスタンスを発表
Hugging FaceとAWSの連携強化により、Inferentia2チップ上で10万以上のモデルが容易にデプロイ可能になった点は、AWSのカスタムAIチップ(Trainium/Inferentia)のエコシステム拡大を加速させる。特にLlama 3 8B/70BのInf2インスタンス上での低コスト推論(0.75ドル/時〜12ドル/時)は、AWSがNVIDIA GPUに依存しない推論基盤を構築しつつあることを示し、半導体ベンダーの競争構造やクラウドAIインフラの価格競争に影響を与える可能性がある。Hugging Faceのプラットフォーム効果とAWSのカスタムチップ戦略が組み合わさることで、AI推論のコスト低下が加速し、AIアプリケーションの普及を促進する点が投資判断上重要。