多ソース糖尿病予測におけるインピュテーションパラドックスとXAIの不一致の定量化:動的ルーティングアーキテクチャを備えた353,680レコードのリークフリースタッキングアンサンブル
Quantifying the imputation paradox and XAI inconsistency in multi-source diabetes prediction: a 353,680-record leakage-free stacking ensemble with dynamic routing architecture
世界で5億3700万人の成人を蝕む糖尿病は、2045年までに7億8300万人に達すると予測されている。4200件以上の機械学習予測研究が存在するにもかかわらず、ベンチマークデータセットへの過度の依存、マルチソース融合における未測定の情報コスト、検証されていないXAI収束仮説により、臨床応用が妨げられている。本研究では、厳格なリークフリープロトコルに基づき、臨床バイオマーカーセット(CBS)とライフスタイル調査セット(LSS)の353,680レコード(455,446候補から)を評価することで、これらの問題に対処する。このプロトコルでは、正規化、インピュテーション、SMOTE合成はトレーニングデータのみで適合された。構造的MNAR欠損下で重要な診断バイオマーカーを中央値補完した場合に発生するAUC損失を、インピュテーションパラドックスとして正式に定義する。Optunaで調整されたスタッキングアンサンブル(ランダムフォレスト、XGBoost、LightGBM)は、保持された70,736サンプルのテストセットで0.8481のAUC-ROCを達成した。単純な平均ベースラインは純粋な識別においてスタッキングをわずかに上回った(AUC 0.8521)が、スタッキングはその優れた精度(0.3439)と解釈可能なメタ学習器の信頼度重みにより維持され、クロスバリデーションAUCは0.8491 ± 0.0014、ベースラインに対するWilcoxon有意差(p < 0.001、n = 1,000レプリケート)を示した。完全なHbA1cおよびグルコースデータでトレーニングされたCBSサブモデルは、0.9781のAUCを達成した。結果として生じる0.130単位のギャップは、この融合によって引き起こされる情報コストを定量化する。これを回復するため、エンドツーエンドの動的ルーティングパイプラインは、患者の28.1%をCBSサブモデルに、71.9%をスタッキングアンサンブルにルーティングし、0.8496のブレンドAUCを達成した。0.30の質量スクリーニング閾値で、モデルはスクリーニングあたり100万人あたり約16,600人の追加の糖尿病患者を特定し、決定曲線分析は5〜30%の閾値範囲全体で正味の利益を確認した。XAI競合分析は、Spearman相関でr = -0.4561(SHAP/順列、p = 0.141)、r = +0.2417(SHAP/LIME、p = 0.737)、r = +0.1494(順列/LIME、p = 0.350)を yielded した。n = 12特徴量(臨界r = ±0.576、α = 0.05)では有意ではないが、これらの手法が特徴量の関連性の構造的に異なる側面を捉えていることを示す予備的な方向性証拠を提供する。
- 353,680件のレコードを用いたリークフリープロトコルに基づく糖尿病予測スタッキングアンサンブルが、テストセットで0.8481のAUC-ROCを達成した。
- 完全なHbA1cおよびグルコースデータでトレーニングされたCBSサブモデルは0.9781のAUCを達成し、マルチソース融合による0.130単位の情報コストを定量化した。
- 端末から端末への動的ルーティングパイプラインにより、患者の28.1%をCBSサブモデルにルーティングし、0.8496のブレンドAUCを達成した。
本稿は糖尿病予測のための機械学習アンサンブル研究であり、35万件超の臨床データを用いて0.8481のAUC-ROCを達成した学術的成果を示す。投資判断に直結するような製品リリースや調達・契約などの具体的な事業的事象は含まれず、純粋な研究発表にとどまるため、投資家向けの即時的なアクションに結びつく情報価値は限定的。