OpenMed、25種にわたるmRNA言語モデルを165ドルでトレーニング
Training mRNA Language Models Across 25 Species for $165
OpenMedは、タンパク質の構造予測、配列設計、コドン最適化を網羅するエンドツーエンドのタンパク質AIパイプラインを構築した。コドンレベルの言語モデリングにおいて、複数のトランスフォーマーアーキテクチャを比較した結果、CodonRoBERTa-large-v2が最も優れた性能を示し、パープレキシティ4.10、CAI相関0.40を達成し、ModernBERTを大きく上回った。その後、25種にスケールアップし、55GPU時間で4つのプロダクションモデルをトレーニングし、他のオープンソースプロジェクトにはない種条件付きシステムを構築した。このパイプラインは、タンパク質工学ワークフローの3つの主要コンポーネント(構造予測、配列設計、コドン最適化)を統合している。特にコドン最適化においては、従来の頻度テーブルに基づく手法ではなく、マスク言語モデリング(MLM)を用いたトランスフォーマーモデルを開発し、生物学的な信号を捉えることに成功した。この研究は、タンパク質工学分野におけるAIの応用と、その効率化および性能向上に貢献するものである。
- OpenMedが、コドンレベルのマスク言語モデリング(MLM)を用いたエンドツーエンドのタンパク質AIパイプラインを構築した
- OpenMedが25種のmRNA言語モデルを55GPU時間でトレーニングし、種条件付きシステムを構築した
OpenMedが公開した、コドンレベルのマスク言語モデリング(MLM)を用いたタンパク質AIパイプラインは、従来の頻度テーブルベースの手法をトランスフォーマーモデルで置き換えるアプローチであり、タンパク質工学ワークフローの大幅な効率化につながる。CodonRoBERTa-large-v2がパープレキシティ4.10、CAI相関0.40を達成した点は、コドン最適化領域でのAI活用の実用性を示す重要なマイルストーン。25種のモデルを55GPU時間でトレーニング可能なコスト効率の良さは、スタートアップや研究機関にとって導入障壁が低いことを意味し、合成生物学・mRNA医薬・タンパク質創薬領域のプレイヤーにとって競争力向上に直結する技術となる。