Open Chain of Thought Leaderboard の紹介
Introducing the Open Chain of Thought Leaderboard
Open Chain of Thought (CoT) Leaderboard は、モデルの精度向上に Chain of Thought (CoT) プロンプティングがどれだけ貢献するかを評価する新しいベンチマークです。これは、モデルの絶対的な精度ではなく、CoT プロンプティングを使用した場合と使用しない場合の精度の差(accuracy gain Δ = accuracy with CoT – accuracy w/o CoT)をスコアリングします。このアプローチは、トレーニングデータ汚染に対する頑健性を高め、モデルの真の推論能力を評価することを目指しています。評価対象のタスクには、LogiQA と LSAT データセットが含まれ、これらは AGIEval ベンチマークの一部です。リーダーボードは、現在 30 のモデルを評価しており、小規模なオープン LLM でも効果的な CoT 推論が可能であること、命令チューニングやチャットチューニングが精度向上に寄与すること、そして CoT の効果はモデルやタスクによって異なり、常に精度を向上させるとは限らないことが示唆されています。開発チームは、さらなるモデルの評価、ダッシュボードの作成、新しい CoT 生成戦略(自己整合性、ツリーオブソートなど)の実装、および評価タスクの拡充を進める計画です。
- Open Chain of Thought Leaderboard が公開され、30モデルのCoT推論精度向上スコアが評価された
本記事は、CoTプロンプティングによる推論能力の向上度合いを測る新しいベンチマーク「Open Chain of Thought Leaderboard」を紹介している。従来の絶対性能評価と異なり、CoT有無の差分(Δ)をスコア化することで、データ汚染への耐性を高めている点が評価手法として独創的である。現時点では学術的なベンチマークに留まるが、モデルの推論力を正確に評価する指標は、AIモデルの性能比較や選定において投資判断の一助となるため、今後のダッシュボード公開や評価タスク拡充の動向に注目したい。