Granite Embedding Multilingual R2: 32Kコンテキスト対応のオープンなApache 2.0多言語埋め込みモデル、100M未満で最高の検索品質を実現
Granite Embedding Multilingual R2: Open Apache 2.0 Multilingual Embeddings with 32K Context — Best Sub-100M Retrieval Quality
IBMは、Apache 2.0ライセンスの多言語埋め込みモデル「Granite Embedding Multilingual R2」を発表しました。このモデルは、ModernBERTアーキテクチャを基盤とし、9700万パラメータのコンパクトモデルと3億1100万パラメータのフルサイズモデルの2種類があります。97Mモデルは、MTEB多言語検索ベンチマークで100M未満のオープンモデルとして最高の60.3を記録し、311Mモデルは65.2を記録しました。両モデルとも200以上の言語に対応し、32Kトークンのコンテキスト長を処理でき、9つのプログラミング言語のコード検索もサポートします。特に97Mモデルは、そのサイズに対して高い検索品質を実現し、多くのフレームワーク(LangChain, LlamaIndex, Haystack, Milvus)との互換性も備えています。311MモデルはMatryoshkaサポートにより、埋め込み次元を削減しても品質低下を最小限に抑えることが可能です。
- IBMがApache 2.0ライセンスの多言語埋め込みモデル「Granite Embedding Multilingual R2」を公開
- 97MパラメータモデルがMTEB多言語検索ベンチマークで100M未満のオープンモデルとして最高スコア60.3を達成
IBMがApache 2.0ライセンスで公開したGranite Embedding Multilingual R2は、97Mパラメータという軽量サイズながらMTEB多言語検索ベンチマークで同クラス最高スコアを達成しており、エッジデバイスやコスト制約のある環境でのRAG(検索拡張生成)用途に最適。32Kトークンの長文対応と200言語以上・9プログラミング言語のコード検索対応により、エンタープライズ向けAIアプリケーションの適用範囲が大きく広がる。LangChainやLlamaIndexなどの主要フレームワークとの互換性も含め、IBMのオープンモデル戦略がエンタープライズAI市場での競争力を高める可能性がある点に注目。