Open LLM LeaderboardをMath-Verifyで改善
Fixing Open LLM Leaderboard with Math-Verify
Hugging Face Hubで最も利用されているOpen LLM Leaderboardは、大規模言語モデル(LLM)の性能を様々なタスクで比較するもので、特に数学問題の性能を評価するMATH-Hardタスクにおいて、3,751の全モデルをMath-Verifyを用いて再評価した。従来の評価方法では、回答形式の不備、SymPyによる解析エラー、比較時の丸め処理や数値評価の欠如などにより、モデルの数学能力が過小評価される問題があった。Math-Verifyの導入により、これらの問題は解決され、モデルの評価がより公平かつ堅牢になった。再評価の結果、平均でモデルは61問多く問題を解けるようになり、全体で4.66ポイントの向上が見られた。特に代数関連のサブセット(AlgebraとPrealgebra)で顕著な改善が見られ、それぞれ8.27ポイントと6.93ポイント向上した。QwenモデルやDeepSeekモデルではスコアが大幅に向上し、NvidiaのAceMathモデルがMATH-Hardリーダーボードの首位となった。リーダーボードのトップ20モデルにも大きな変動があり、多くのモデルが順位を大きく上げた。
- Hugging FaceのOpen LLM LeaderboardがMATH-HardタスクにおいてMath-Verifyを用いた再評価を実施し、3,751モデルを再評価した
- 再評価の結果、NvidiaのAceMathモデルがMATH-Hardリーダーボードの首位となった
- QwenモデルおよびDeepSeekモデルが再評価でスコアを大幅に向上させた
MATH-Hardリーダーボードの再評価により、従来の評価手法ではモデルの数学能力が過小評価されていたことが明らかになった。Math-Verify導入によりQwenやDeepSeekモデルのスコアが大幅に向上した点は、これらのモデルを開発する企業の技術力再評価につながる。また、NvidiaのAceMathモデルが首位になったことは、GPUベンダーが自社モデルでも競争力を示したという点で注目に値する。評価手法の改善自体は投資家にとって直接的なインパクトは限定的だが、特定モデルの真の性能が明らかになったことで、LLMの性能比較に基づく投資判断の精度向上につながる可能性がある。