Gemma 4: デバイス上で動作する最先端のマルチモーダルAI
Welcome Gemma 4: Frontier multimodal intelligence on device
Googleは、Apache 2.0ライセンスで提供されるオープンソースのマルチモーダルAIモデル「Gemma 4」を発表しました。Gemma 4は、画像、テキスト、音声入力をサポートし、テキスト応答を生成します。モデルは、画像エンコーダーの改良(可変アスペクト比、設定可能な画像トークン入力数)、長コンテキストウィンドウ対応、Per-Layer Embeddings (PLE)、共有KVキャッシュなどの新機能を含みます。E2B (2.3B)、E4B (4.5B)、31B、26B A4B (4Bアクティブ) の4つのサイズがあり、それぞれベースモデルと命令ファインチューニング済みモデルが提供されます。Gemma 4は、OCR、音声認識、物体検出、コード生成、画像キャプション生成など、多様なタスクで高い性能を示し、特にGUI要素検出やバウンディングボックス生成において、追加の指示なしにJSON形式で直接出力する能力が実証されました。また、動画や音声の理解能力も向上しており、様々なツールやライブラリ(transformers, llama.cpp, MLX, WebGPU, Rust)で利用可能です。
- GoogleがオープンソースのマルチモーダルAIモデル「Gemma 4」をApache 2.0ライセンスで発表
GoogleがGemma 4をオープンソース(Apache 2.0)で公開した点は、エッジAI/デバイス上AIの民主化を加速させる重要な出来事。特に、可変アスペクト比の画像エンコーダー、長コンテキストウィンドウ、共有KVキャッシュなどの技術的進歩により、小規模モデルでも高度なマルチモーダル処理(OCR、音声認識、物体検出、コード生成)が可能になった。31Bや26B A4Bといった比較的大きなサイズも含まれており、デバイス上推論の性能限界を押し上げる可能性が高い。オープンソース戦略により、競合するMeta LlamaやMistralに対するポジショニングを強化しており、エッジAI向け半導体・デバイスメーカーにとってもエコシステムの拡大要因となる。