LLMは古典的なハイパーパラメータ最適化アルゴリズムを凌駕できるか? autoresearchを用いた研究
Can LLMs Beat Classical Hyperparameter Optimization Algorithms?
本研究では、LLMエージェントがコードを直接編集してハイパーパラメータを最適化できるautoresearchリポジトリをテストベッドとして使用し、古典的なハイパーパラメータ最適化(HPO)アルゴリズムとLLMベースの手法を比較した。固定された計算予算内で小規模言語モデルのハイパーパラメータ調整を行った結果、固定された探索空間ではCMA-ESやTPEといった古典的手法がLLMベースのエージェントを上回った。特に、メモリ不足のエラーを回避することが探索の多様性よりも重要であることが示された。LLMにソースコードの直接編集を許可すると、古典的手法との差は縮まったものの、Claude Opus 4.6やGemini 3.1 Pro Previewといった最先端モデルを用いても差は解消されなかった。LLMは試行間で最適化状態を追跡することに苦労する一方、古典的手法はLLMの持つドメイン知識を欠いている。これらの強みを組み合わせるため、本研究ではCMA-ESの解釈可能な内部状態(平均ベクトル、ステップサイズ、共分散行列など)をLLMと共有するハイブリッド手法「Centaur」を導入した。Centaurは実験で最良の結果を達成し、0.8BのLLMでも古典的手法および純粋なLLM手法すべてを上回ることができた。制約のないコード編集では、より大規模なモデルが必要となる。本研究ではさらに、探索の多様性、0.8Bから最先端モデルまでのモデルスケーリング、CentaurにおけるLLM提案トライアルの割合についても分析した。結果として、LLMは古典的オプティマイザの代替ではなく、補完として最も効果的であることが示唆された。
- LLMエージェントによるハイパーパラメータ最適化(HPO)性能を、古典的手法(CMA-ES, TPE)と比較した研究結果が公開された。
- 固定探索空間では古典的手法CMA-ESやTPEがLLMベース手法を上回り、LLM単体では最適化状態の追跡に課題があることが示された。
- LLMとCMA-ESを組み合わせたハイブリッド手法「Centaur」が提案され、0.8Bの小規模LLMでも全比較手法を上回る最良結果を達成した。
本論文は、LLMベースのハイパーパラメータ最適化(HPO)が古典的アルゴリズム(CMA-ES, TPE)に対して、固定計算予算では劣ることを実証した点が重要。さらに、両者の強みを組み合わせたハイブリッド手法「Centaur」が提案されており、0.8Bという小規模LLMでもCMA-ES+LLMの複合で純粋なLLM手法や古典的手法を上回った。これは、LLMのドメイン知識と古典的オプティマイザの探索効率を融合する方向性に実用性があることを示唆しており、特に計算資源制約のある環境でのAIチューニング自動化において、LLM単体ではなくハイブリッド戦略が有効であるという投資判断の材料となる。