BLIP-2によるゼロショット画像-テキスト生成
Zero-shot image-to-text generation with BLIP-2
BLIP-2は、既存の事前学習済み画像エンコーダーと大規模言語モデル(LLM)を組み合わせるための新しい視覚言語事前学習パラダイムを導入したモデルです。画像とテキストの間のモダリティギャップを埋めるために、軽量なクエリアングトランスフォーマー(Q-Former)を、凍結された画像エンコーダーと凍結されたLLMの間に配置します。Q-Formerは学習可能な唯一の部分であり、2段階の事前学習を経て、画像キャプション生成、画像-テキスト検索、視覚的質問応答などのタスクで最先端の結果を達成しつつ、学習パラメータ数と事前学習コストを大幅に削減します。Hugging Face Transformersライブラリを通じて、事前学習済みのBLIP-2モデル(例: Salesforce/blip2-opt-2.7b)を簡単に利用でき、ゼロショットで画像キャプション生成や視覚的質問応答などのタスクを実行できます。
- BLIP-2モデルが提案され、Q-Formerによる軽量なマルチモーダル学習パラダイムが公開された
BLIP-2は、凍結済みの画像エンコーダーとLLMを軽量モジュール(Q-Former)で橋渡しするアーキテクチャにより、少ない学習パラメータで最先端のマルチモーダル性能を達成した点が重要。学習コストの大幅削減とモジュール交換の柔軟性は、産業応用へのハードルを下げるため、マルチモーダルAIの民主化・商用化を加速させる可能性がある。特にHugging Faceを通じた容易な利用が可能な点は、エコシステムの拡大とスタートアップの参入障壁低下につながり投資視点で注目すべき。