Hugging FaceとNVIDIA NIMによるサーバーレス推論APIの提供開始
Serverless Inference with Hugging Face and NVIDIA NIM
Hugging Faceは、NVIDIA DGX Cloudのコンピューティングプラットフォームを活用した「Hugging Face NVIDIA NIM API (serverless)」を、Enterprise Hub組織向けに提供開始した。これにより、LlamaやMistralなどの人気生成AIモデルの推論を、サーバーレスかつ標準化されたAPIで容易に実行できる。このサービスはNVIDIAとの連携を強化したもので、インフラの初期費用やLLM推論の最適化といった開発者の課題を解決する。利用は従量課金制で、NVIDIA H100 GPUを使用し、リクエスト時間に応じて課金される。例えば、meta-llama/Meta-Llama-3-8B-Instructモデルでは1秒あたり0.0023ドルが見込まれる。NVIDIA NIM API (serverless)はOpenAI APIと標準化されており、openai SDKを利用して推論を実行できる。現在、chat.completions.createとmodels.list APIのみをサポートしているが、今後対応モデルやAPIの拡充が予定されている。
- Hugging FaceがNVIDIA DGX Cloudを活用したサーバーレス推論APIをEnterprise Hub組織向けに提供開始
Hugging FaceがNVIDIA DGX Cloud上でサーバーレス推論APIを提供開始したことは、生成AIモデルの推論インフラがよりアクセスしやすく、標準化(OpenAI互換API)される方向性を示している。従量課金制で初期費用不要なため、スタートアップや中小企業のAI活用障壁を下げ、LlamaやMistralなどのオープンモデルの普及を加速させる。NVIDIAにとってもDGX Cloudの稼働率向上とH100 GPUの需要拡大につながる好循環を生む。競合するAmazon BedrockやGoogle Vertex AIとの差別化要素として、オープンエコシステムとの親和性が強みとなる。