Text Generation Inference (TGI) が TensorRT-LLM および vLLM のマルチバックエンドサポートを導入
Introducing multi-backends (TRT-LLM, vLLM) support for Text Generation Inference
Hugging Face は、大規模言語モデル (LLM) のデプロイメントを容易にする Text Generation Inference (TGI) に、TensorRT-LLM (TRT-LLM) および vLLM を含むマルチバックエンドサポートを導入したことを発表しました。この新アーキテクチャにより、TGI は単一の統合フロントエンドレイヤーとして機能し、ユーザーはモデル、ハードウェア、パフォーマンス要件に応じて最適なバックエンドを選択できるようになります。TGI は Rust と Python で主に書かれており、Rust は HTTP およびスケジューリングレイヤーを、Python はモデリングを担当します。今後、llama.cpp、AWS Neuron、Google TPU のバックエンドサポートも追加予定です。この機能は、Inference Endpoints でも利用可能になる予定です。
- Hugging Face が TGI に TensorRT-LLM および vLLM のマルチバックエンドサポートを導入した
Hugging Face が TGI にマルチバックエンドアーキテクチャを導入したことは、LLM 推論インフラの標準化が進んでいる証左。TensorRT-LLM(NVIDIA)や vLLM という競合バックエンドを同一フレームワークで選択可能にすることで、ユーザーはベンダーロックインを回避しつつ最適な推論エンジンを利用できるようになる。これは推論最適化の市場競争を促進し、結果的に LLM 推論コストの低下と普及加速につながる。特に Inference Endpoints でも利用可能になる予定である点は、Hugging Face のプラットフォーム戦略上重要なエコシステム強化であり、同社の収益源拡大にも寄与する可能性がある。