NPHardEvalリーダーボード:複雑性クラスと動的更新による大規模言語モデルの推論能力の解明
NPHardEval Leaderboard: Unveiling the Reasoning Abilities of Large Language Models through Complexity Classes and Dynamic Updates
NPHardEvalは、大規模言語モデル(LLM)の推論能力を評価するための動的かつ複雑性に基づいたフレームワークを導入しました。このフレームワークは、NP困難な複雑性クラスおよびそれ以下のクラスにまたがる900のアルゴリズム問題を提示し、LLMを厳密にテストします。過学習を防ぐため、毎月更新されます。NPHardEvalは計算複雑性クラスを採用することで、LLMの推論スキルを定量化可能で堅牢な尺度を提供します。ベンチマークのタスクは現実世界の意思決定課題を反映しており、その関連性と適用性を高めています。毎月のベンチマークデータポイントの更新は、モデルの過学習リスクを軽減し、信頼性の高い評価を保証します。NPHardEvalは、自動化された動的なベンチマーク戦略と、LLMの推論を評価する新しい方法を導入しました。質問はアルゴリズム的に計算可能な問題に基づいており、人間の介入なしに正誤判定が可能です。これにより、毎月新しい難易度の質問を生成し、モデルの過学習を防ぐことができます。評価指標として、重み付き精度(Weighted Accuracy)と失敗率(Failure Rate)の2つを使用します。実験結果によると、一般的にクローズドソースモデルがオープンソースモデルよりも優れており、GPT-4 Turboが全体で最高のパフォーマンスを示しました。モデルは一般的に複雑性の低い問題でより良いパフォーマンスを示しますが、NP完全(中程度の複雑性)の問題で最もパフォーマンスが良いモデル(例:Claude 2)もあります。一部のオープンソースモデルは特定の質問でクローズドソースモデルを上回る可能性があります。主要なオープンソースモデルには、Yi-34b、Qwen-14b、Phi-2、Mistral-7bが含まれます。NPHardEvalのリーダーボード、データセット、コードはGitHubとHugging Faceで公開されており、コミュニティがアクセスし、貢献できるようになっています。
- NPHardEvalベンチマークフレームワークが公開された。NP困難な複雑性クラスにわたる900のアルゴリズム問題を提供し、毎月更新される。
- GPT-4 TurboがNPHardEvalリーダーボードで最高性能を示したことが報告された。
NPHardEvalはLLMの推論能力をNP困難なアルゴリズム問題で評価する新しいベンチマークであり、毎月問題を更新して過学習を防ぐ設計が実用的だ。GPT-4 Turboが最高性能を示す一方、一部のオープンソースモデル(Yi-34b、Qwen-14b等)が特定領域でクローズドソースモデルを上回るケースがある点は、オープンモデルの競争力向上を示唆する。LLMの推論能力を定量化・継続評価できる本ベンチマークは、モデル選定や性能評価における投資判断の補助ツールとして注目に値する。