全ゲノムデータにおける疾患原因バリアント検出のための機械学習アプローチは、機能遺伝子の発現を考慮する必要がある
Machine Learning approaches for the detection of disease-causing variants in whole-genome data need to address the expression of functional genes
疾患の原因となる遺伝子バリアントの検出において、機械学習(ML)アプローチの有効性を評価するため、実データと合成データを含むベンチマークが構築された。このベンチマークを用いて標準的な統計学習/MLモデルが訓練され、疾患表現型の分類が行われた。その結果、分類性能で常に最高とは限らないものの、合成データセット全体で原因遺伝子の特定においてロジスティック回帰モデルが最も信頼性が高いことが判明した。UK Biobankデータセットでの訓練失敗後、モデル性能とデータセットの豊富さに関する分析が行われ、疾患を正確に予測するためには機能遺伝子の発現を考慮することが不可欠であることが示された。
- 実データと合成データを含むベンチマークを構築し、疾患原因バリアント検出のためのMLモデル評価を実施した
- 合成データセット全体でロジスティック回帰モデルが原因遺伝子の特定に最も信頼性が高いと判明した
- UK Biobankデータセットでの訓練失敗を受け、疾患予測には機能遺伝子の発現考慮が不可欠と示された
疾患原因バリアント検出における機械学習モデルのベンチマーク評価は、ゲノム医療・精密医療分野のAI活用の進展を示す。特にUK Biobankのような大規模実データでの訓練失敗と機能遺伝子発現の重要性の指摘は、ゲノム×AIスタートアップの技術的課題とデータ戦略の重要性を示唆しており、投資判断においては単なるモデル精度だけでなくデータ品質と生物学的文脈の理解が競争優位性につながる点に注目したい。