A.I.AI
Cerebras、Gemma 4 31Bを1,800トークン/秒超で実行し、最速のマルチモーダル推論を実現
Gemma 4 on Cerebras - The Fastest Inference Is Now Multimodal
YHacker News
AIが原文を翻訳・要約しています
Cerebrasは、Google DeepMindのオープンモデル「Gemma 4 31B」を、毎秒1,800トークンを超える速度で実行できることを発表しました。これは、従来のGPUエンドポイントと比較して35倍の速度であり、画像を含むマルチモーダル推論をリアルタイムで可能にします。この技術により、コンピュータ利用や画像に基づいたエージェントワークフローなど、新たなクラスのアプリケーションが実現します。Gemma 4 31Bは、Apache 2.0ライセンスの下で提供されるオープンウェイトモデルであり、Cerebrasのウェーハースケール技術との組み合わせにより、開発者は高速なビジュアルおよびエージェントワークフローを実行するためのプラットフォームを得られます。このモデルは、クロード・Haiku 4.5と同等の知能を持ちながら、Cerebras上では18倍高速に動作します。現在、Cerebras Inference Cloudでパブリックプレビューとして提供されています。
KEY POINTS要点記事から抽出した重要情報
- CerebrasがGoogle DeepMindのGemma 4 31Bを毎秒1,800トークン超で実行可能と発表
- 従来のGPUエンドポイント比で35倍の高速推論を実現
- Gemma 4 31BはApache 2.0ライセンスのオープンウェイトモデルで、Cerebras Inference Cloudでパブリックプレビュー公開中
CONTEXT文脈編集部による背景整理
Cerebrasが独自のウェーハースケール技術を用いて、オープンウェイトモデルGemma 4 31Bを従来GPU比35倍の速度で推論できることを実証した点は、AI推論のハードウェア競争においてCerebrasが差別化を図れる可能性を示している。GPU以外の推論アクセラレータが現実的なパフォーマンスを達成している証左であり、特にレイテンシ重視のエージェントワークフローやマルチモーダル用途で需要を取り込めるかが今後の注目点。
原文を読むAnalyzed at 2026年7月1日 10:07