トランスフォーマーベースの分子表現学習を用いたAI駆動型創薬
AI-driven drug discovery using transformer-based molecular representation learning
化学空間の組み合わせ規模と実験スクリーニングの低スループットにより、化学的に妥当で薬物様分子の大部分が未探索のままである。この問題に対処するため、ターゲット特異的な効力予測のためのトランスフォーマーベースの分子モデリングフレームワークが導入された。このフレームワークは、アルツハイマー病、糖尿病、がんターゲットのBindingDBバイオアッセイデータを用いて訓練され、正確なpIC50回帰と二値活性分類を提供する。SMILES文字列上で直接訓練されたByte Latent Transformer (BLT) を使用し、定量的構造活性相関に基づいて化合物の活性と効力の変化を予測する。このモデルは、SMILES表現の構文的および高レベルの化学的特徴を捉え、同じ分子情報で訓練された潜在モデルを使用してバイトレベルの予測を実行する。効力予測は、化学的に記述された分子検索エンジンの内部で実行され、確率性、SMILESベースの量変異、薬物様ルール、および適応的探索ヒューリスティクスを活用して局所的最小値を回避する。最適化された候補分子と局所的最適解は、高効力リードの周りの構造的多様性を維持しながら、誘導SMILES変異を通じて生成される。このフレームワークは、アルツハイマー病、糖尿病、がんターゲット全体で高い精度(R2 0.95–0.98)のpIC50回帰と二値活性分類を提供し、多様な生物学的ターゲットに対する堅牢な仮想スクリーニングとリード優先順位付けを可能にする。
- トランスフォーマーベースの分子モデリングフレームワーク(BLT)がアルツハイマー病、糖尿病、がんターゲットのBindingDBバイオアッセイデータを用いて訓練された
- 本フレームワークがpIC50回帰と二値活性分類においてR2 0.95–0.98の高い精度を達成した
- SMILESベースの分子検索エンジンにより、最適化された候補分子と局所的最適解を生成する仕組みが実装された
本記事は、創薬プロセスの効率化においてトランスフォーマーベースの分子表現学習が高い精度(R2 0.95–0.98)でpIC50回帰と活性分類を実現した点が注目に値する。仮想スクリーニングとリード最適化を統合したフレームワークであり、従来の実験スクリーニングの低スループット課題を解決する可能性を秘めている。アルツハイマー病、糖尿病、がんという市場規模の大きい治療領域を対象としており、製薬企業や創薬スタートアップにとって競争力向上につながる技術基盤となり得る。投資家としては、このフレームワークの実用化段階や、製薬企業との協業・ライセンス契約の有無を引き続き注視すべきである。