テキストから画像へのモデルのトレーニング設計:アブレーションからの教訓
Training Design for Text-to-Image Models: Lessons from Ablations
本記事は、効率的なテキストから画像へのモデルをゼロからトレーニングするシリーズの第2弾であり、アーキテクチャではなくトレーニングに焦点を当て、モデルのトレーニング速度、収束の信頼性、表現学習を改善する手法を探求する。標準的なコンポーネントと補助目的、アーキテクチャのショートカットを使用しないシンプルなベースラインランを設定し、100Kステップ、256x256解像度、バッチサイズ256、AdamWオプティマイザ、GemmaT5テキストエンコーダなどの設定で、MidJourneyV6で生成された1Mの合成画像データセットを使用する。評価指標としてFID、CMMD、DINOv2-MMD、ネットワークスループット(batches/sec)を用いる。表現アライメント手法としてREPA(DINOv3/DINOv2教師を使用)は、FIDを18.2から14.64/16.6に改善するが、スループットは低下する。iREPAはREPAの空間情報を強化する微調整だが、一貫性がなく採用を見送る。REPAは初期段階で有効だが、後続段階では学習を妨げる可能性があるため、段階的なスケジュールでの使用が推奨される。潜在空間の設計では、REPA-E-VAEとFlux2-AEを比較し、どちらもFIDを約6ポイント改善するが、Flux2-AEはスループットを大幅に低下させる。Contrastive Flow Matchingは、条件付き生成におけるフローの重複を減らし、質を向上させるが、本実験ではFIDの改善は見られず、低コストの正則化として採用を検討する。
本記事はテキスト-画像生成モデルのトレーニング最適化に関する研究知見の共有であり、特定の企業の製品発表や資金調達、業績に直結する具体的なビジネス事象は含まれていない。投資判断に資する企業動向や市場インパクトのある発表ではないため、out_of_scopeと判断する。