Amazon SageMaker 向け Hugging Face Embedding Container のご紹介
Introducing the Hugging Face Embedding Container for Amazon SageMaker
Hugging Face は、Amazon SageMaker で推論のためにオープンな Embedding モデル(例: Snowflake/snowflake-arctic-embed-l, BAAI/bge-large-en-v1.5, sentence-transformers/all-MiniLM-L6-v2)をデプロイするための新しい Hugging Face Embedding Container を発表しました。このコンテナは、Text Embedding Inference (TEI) を活用しており、高速かつメモリ効率の良い推論を実現します。記事では、開発環境のセットアップ、コンテナの取得、Snowflake Arctic モデルの SageMaker へのデプロイ、推論パフォーマンスの評価(CPU インスタンスで 3,900 リクエスト/約 841 秒、GPU インスタンスで 100 万トークン/約 30 秒)、およびリソースのクリーンアップについて解説しています。CPU インスタンスは低コスト運用に適しており、GPU インスタンスは高速なバッチ処理に適しています。
- Hugging Face が Amazon SageMaker 向けの新しい Embedding Container を発表
- 本コンテナは Text Embedding Inference (TEI) を活用している
Hugging FaceがAmazon SageMaker向けに専用のEmbedding推論コンテナを提供開始した点は、エンタープライズ向けMLOps/AIインフラのエコシステム拡大という観点で注目に値する。特にSnowflake ArcticやBGEなど高性能なオープンソース埋め込みモデルを、CPU/GPU両方のインスタンスで簡単かつ効率的にデプロイできるようになることで、RAGやベクトル検索を活用する企業アプリケーションの導入障壁が下がる。SageMaker上での推論最適化が進むほど、AWSのAIインフラ利用が促進され、競合するVertex AIやAzure AIとの差別化要因となる。