医療分野における大規模言語モデルのベンチマーク:Open Medical-LLM Leaderboard
The Open Medical-LLM Leaderboard: Benchmarking Large Language Models in Healthcare
Open Medical-LLM Leaderboardは、医療分野における大規模言語モデル(LLM)の性能を評価・比較するための標準化されたプラットフォームを提供する。GPT-3やMed-PaLM 2のようなLLMは医療分野での応用が期待される一方、誤った情報提供は患者に深刻な影響を与える可能性があるため、医療ドメインに特化した評価が不可欠である。このリーダーボードは、USMLE(MedQA)、インドの医学部入試(MedMCQA)、PubMed論文(PubMedQA)、および医学関連のMMLUサブセット(Clinical Knowledge, Medical Genetics, Anatomy, Professional Medicine, College Biology, College Medicine)を含む多様な医療QAタスクでモデルを評価する。評価指標は主に精度である。GPT-4-baseやMed-PaLM-2といった商用モデルが高い精度を示す一方、Starling-LM-7Bなどのオープンソースモデルも健闘している。Gemini Proは一部の領域で強みを見せるものの、解剖学などの分野では改善の余地がある。モデルの提出には、Safetensors形式への変換、Transformersライブラリとの互換性確認、モデルの公開が必要となる。将来的には、放射線学、病理学、ゲノミクスなどのデータセットの追加や、精度以外の評価指標の導入も計画されている。
- Open Medical-LLM Leaderboardが公開され、医療分野のLLM性能評価基準が標準化された
医療分野特化のLLMベンチマークプラットフォームが公開されたことで、モデル間の性能比較が標準化され、医療AI市場における競争環境が可視化された。GPT-4-baseやMed-PaLM-2といった商用モデルがリードする一方、Starling-LM-7Bのような7Bパラメータ級のオープンソースモデルも健闘しており、軽量モデルの医療応用可能性を示唆する点に注目。今後、放射線学・病理学・ゲノミクスなど専門領域のデータセット追加が計画されており、医療AIバリューチェーン全体での投資機会の創出が期待される。