Microsoftの最先端ビジョン言語モデルFlorence-2のファインチューニング
Fine-tuning Florence-2 - Microsoft's Cutting-edge Vision Language Models
MicrosoftのFlorence-2は、画像とテキストを入力とし、テキストを出力するシーケンス・トゥ・シーケンスモデルであり、DaViTビジョンエンコーダーとBERTを組み合わせたアーキテクチャを持つ。その強みは、画像、ボックス、マスク、キャプションなど50億以上の注釈を含む1億2600万枚の画像からなるFLD-5Bデータセットによる事前学習にある。この記事では、Florence-2をDocVQA(文書画像に関する質問応答)タスクにファインチューニングする例を紹介している。ファインチューニング前の検証データセットにおけるモデル予測と正解の類似度は0であったが、7エポックのファインチューニング後、類似度は57.0に向上した。ファインチューニングには、学習率1e-6、バッチサイズ6(A100 GPU)、またはバッチサイズ1(T4 GPU)といったリソース制約のある環境での実験も行われた。より多くのリソース(8つのH100 GPU)を用いた場合、バッチサイズ64で70分間の学習でモデル全体をファインチューニングできた。このファインチューニングにより、Florence-2はカスタムデータセットや新しいタスクに対して短時間で高いパフォーマンスを発揮できることが示され、特にリソースが限られた環境やコスト効率が求められる本番環境での活用が期待される。
- Microsoftがビジョン言語モデルFlorence-2のDocVQAタスクへのファインチューニング結果を公開
本記事はMicrosoftのビジョン言語モデルFlorence-2のファインチューニング事例を紹介している。注目すべき点は、事前学習済みの大規模モデルを限られたリソース(T4 GPUやバッチサイズ1)でも短期間で特定タスクに適応させ、検証類似度を0から57.0に向上させたことである。これは、AIモデルの実運用コスト低減とカスタマイズ容易性を示しており、エンタープライズ向けAI導入の加速やモデルサービスプラットフォームの競争力に影響を与える可能性がある。特に、8つのH100 GPUを用いた70分の学習でモデル全体をファインチューニングできる点は、本番環境でのコスト効率と導入障壁の低下を示唆している。