DharmaOCR、ブラジルポルトガル語OCRでMistral OCR4やUnlimited-OCRを上回る専門化の優位性を示す
Newer Models, Same Advantage
DharmaOCRは、ブラジルポルトガル語に特化したドメイン専門化とターゲットトレーニングにより、Mistral OCR4やUnlimited-OCRといった新しいアーキテクチャを持つモデルを上回るOCR性能を示した。DharmaOCRは2段階のトレーニングパイプラインを採用。第1段階では、ブラジルポルトガル語の語彙、構文、文書構造にモデルの重みを適合させるための教師ありファインチューニングを実施。第2段階では、直接選好最適化(DPO)を適用し、競合する出力間の比較データから学習させることで、推論時の抽出安定性を向上させた。この専門化により、DharmaOCRはポルトガル語に特化したベンチマークで0.925のスコアを達成し、Mistral OCR4(0.798)やUnlimited-OCR(0.7587)を大幅に上回った。特に、ブラジルポルトガル語特有の語彙や固有名詞を含む文書(例:ENEMエッセイ)において、DharmaOCRは正確な文字起こしを行った一方、他モデルは誤字や意味不明な出力を生成する傾向が見られた。また、DPOによるトレーニングは、低品質なスキャンや小さいフォントなどの視覚的な困難に直面した際のテキスト生成の不安定性(デグレネーション)を抑制し、実用的なデータ生成を可能にする。
- DharmaOCRがブラジルポルトガル語に特化したドメイン専門化により、Mistral OCR4やUnlimited-OCRを上回るOCR性能(ベンチマークスコア0.925)を達成した
- DharmaOCRは教師ありファインチューニングと直接選好最適化(DPO)の2段階トレーニングパイプラインを採用している
- ブラジルポルトガル語特有の語彙や固有名詞を含むENEMエッセイ等の文書で、他モデルより正確な文字起こしを実現した
本記事は、OCR分野におけるドメイン専門化戦略の有効性を示すものである。汎用大規模モデル(Mistral OCR4)よりも、特定言語(ブラジルポルトガル語)に特化してファインチューニング+DPOを施した小規模モデルが、特定タスクで優位に立つケースがあることを実証している。投資家視点では、AI応用において「汎用モデル一強」ではなく、ニッチ領域での専門化モデルが差別化可能であること、およびDPOという軽量な学習手法が実用レベルの品質向上に寄与している点に注目したい。OCR市場は文書電子化・業務自動化の基盤技術であり、特定言語・特定ドメインでの高精度OCRはBPOや行政・教育分野での実用価値が高い。