Hugging Face Infinityと最新CPUによるミリ秒レイテンシのケーススタディ
Case Study: Millisecond Latency using Hugging Face Infinity and modern CPUs
Hugging Faceは、Transformerモデルのデプロイにおけるレイテンシ問題を解決するため、低レイテンシ・高スループット・ハードウェアアクセラレーション推論パイプラインを提供するコンテナソリューション「Hugging Face Infinity」を発表した。Infinityは、Dockerコンテナとして提供されるInfinity Containerと、モデルをターゲットハードウェア向けに最適化するInfinity Multiverseの2つのサービスから構成される。最新世代のIntel Xeon CPU(Ice Lake)を搭載したAmazon EC2 C6iインスタンス上でInfinityのパフォーマンスをベンチマークした結果、従来のCascade Lakeベースのインスタンスと比較して最大34%向上し、Vanilla Transformersと比較して最大800%向上した。特に、2つの物理コアとバッチサイズ1で実行した場合、シーケンス長64トークンまでで1-4msのレイテンシを実現し、Transformerモデルの最適化により、インフラコスト削減やリアルタイムユースケースの実現が可能になるとしている。
- Hugging Faceが低レイテンシ推論パイプライン「Hugging Face Infinity」を発表した
- InfinityをIntel Xeon CPU (Ice Lake)搭載のAmazon EC2 C6iインスタンス上でベンチマークし、従来比最大34%向上、Vanilla Transformers比最大800%向上を実証した
Hugging Faceが提供するInfinityは、Transformerモデルの推論レイテンシをミリ秒単位にまで短縮するコンテナソリューションであり、従来比最大800%の性能向上を実現している。特にIntel Ice Lake世代のXeon CPUとの組み合わせでコスト効率よくリアルタイム推論が可能になる点は、AI推論のエッジ・オンプレミス展開やレイテンシ厳格要件(音声対話、金融取引、産業制御など)のユースケース拡大に直結する。推論高速化によるインフラコスト削減はAI導入企業の利益率改善に寄与するため、同社のSaaS / デプロイメントプラットフォームの競争力強化と収益成長を期待させる。