Transformers Code AgentがGAIAベンチマークでトップに
Our Transformers Code Agent beats the GAIA benchmark 🏅
Hugging FaceのTransformersライブラリのCode Agentが、最も困難で包括的なエージェントベンチマークとされるGAIAでトップの成績を収めた。このCode Agentは、外部ツールを呼び出す能力を持ち、LLMの出力を基にタスクの実行構造を変更できるエージェントシステムを構築するTransformers Agentsフレームワークに基づいている。GAIAの質問は、画像認識、複数情報の収集、制約されたフォーマットでの回答など、LLMベースのシステムが苦手とする複数の難易度を伴う。GPT-4 Turboが7%未満の平均スコアに留まる中、このCode Agentは44.2%(検証セット)を達成し、検証セットで1位となった。テストセットでは33.3%で2位だが、Microsoft Autogenを上回る。この成功は、JSON形式よりも効率的で表現力豊かなコード形式でのアクション記述が、エージェントシステムのパフォーマンス向上に寄与することを示唆している。開発チームは、LLMエンジンの改善、マルチエージェントオーケストレーションの強化、Seleniumパッケージを利用したWebブラウザツールの改良、計画戦略の最適化などを今後の改善点として挙げている。
- Hugging FaceのTransformersライブラリのCode AgentがGAIAベンチマークで検証セット1位(44.2%)、テストセット2位(33.3%)を達成した
Hugging FaceのCode AgentがGAIAベンチマークでGPT-4 Turbo(7%未満)を大きく上回る44.2%を達成した点は、コード形式でアクションを記述するLLMエージェントの設計手法が従来のJSON方式より優れていることを示している。エージェント機能の差別化がLLM競争の新たな軸となりつつあり、エージェントフレームワークやツール統合に強みを持つスタートアップへの投資機会につながる可能性がある。