分子・食品予測タスクにおける大規模言語モデル評価のためのベンチマーク
A benchmark for assessing large language models on molecular-to-food and food-to-molecular prediction tasks
本研究は、大規模言語モデル(LLM)の食品化学分野における能力を評価するため、分子から食品への予測(MFP)と食品から分子への予測(FMP)の2つのタスクからなる新しいベンチマークを導入した。このベンチマークをサポートするために、FlavorDBデータセットをキュレーション・標準化し、フレーバー分子の関連付けのための堅牢なテストベッドを作成した。Kimi-K2、DeepSeek-V3.2(オープンソース)、Gemini-3-Pro、GPT-5.1、Seed-1.8(クローズドソース)の5つのモデルをゼロショットおよびワンショットのコンテキスト内学習設定で評価した。FMPタスクでは、Gemini-3-Proがゼロショットで最高のF1スコア0.556を達成し、Kimi-K2がワンショット設定でF1スコア0.522を記録した。コンテキスト内学習は、特に複雑なマルチフードタスクにおいてKimi-K2のF1スコアを0.451から0.496に向上させるなど、モデル全体のパフォーマンスを一貫して向上させた。また、食品化学における専門的な推論エラーの4つの繰り返しカテゴリを特定し、一般的なモデルが直面する根本的な課題を明らかにした。この研究は、知識集約型ドメインにおけるLLMの可能性を厳密に評価するためのフレームワークを確立するとともに、フレーバー最適化や新規食品製品開発の実用的な応用への重要な基盤を提供する。
本記事は、LLMが食品化学ドメイン(フレーバー分子予測・食品開発)においてどの程度の推論能力を持つかを評価するベンチマーク研究である。研究そのものは学術的価値があるが、特定の企業業績や製品化に直結する具体的な発表・資金調達・規制・市場変化を含んでおらず、現時点で投資判断に活用できる材料は乏しい。したがってout_of_scopeと判断した。