Cloudflare Workers AIでHugging Faceユーザー向けにサーバーレスGPU推論を提供開始
Bringing serverless GPU inference to Hugging Face users
Cloudflareは、Hugging Faceとの戦略的パートナーシップを拡大し、開発者がGPUインフラストラクチャやサーバーを管理することなく、生成AIアプリケーションを構築できる「Deploy on Cloudflare Workers AI」を発表しました。これにより、利用したコンピューティングリソースのみに課金される低コストで、サーバーレスなGPU推論が可能になります。例えば、Meta Llama 2 7Bモデルを使用し、1日あたり約1000リクエスト(入力1kトークン、出力100トークン)のRAGアプリケーションの場合、LLM推論の運用コストは約1日あたり1ドルになると試算されています。この機能は、Workers AI REST APIまたはCloudflare AI SDKを通じて利用でき、Llama、Gemma、Mistralなどの人気モデルがサポートされています。CloudflareのCTOであるJohn Graham-Cumming氏は、この統合により、開発者がCloudflareのグローバルなサーバーレスGPUネットワークとHugging Faceの人気オープンソースモデルを活用できるようになり、イノベーションが促進されると述べています。
- CloudflareがHugging Faceとの提携拡大により、サーバーレスGPU推論「Deploy on Cloudflare Workers AI」を発表
- Meta Llama 2 7Bモデルを用いたRAGアプリの推論コストを約1日1ドルと試算
CloudflareがHugging Faceとの提携を拡大し、サーバーレスGPU推論を提供開始したことは、エッジAI推論の民主化とコスト低下を象徴する動き。Workers AIという既存のエッジコンピューティング基盤にHugging Faceの人気OSSモデル群がシームレスに統合されることで、開発者はGPU管理不要で低コスト(例: Llama 2 7B × 1000 req/day で約1ドル/日)に生成AIをデプロイ可能になる。これはAI推論のクラウド依存からエッジシフトを加速し、クラウドAIインフラ競争におけるCloudflareの差別化要因となる。投資家としては、サーバーレスAI推論の普及がGPU需要の裾野拡大と同時に、エッジAIプラットフォーム企業の収益機会拡大につながる点に注目したい。