Gaia2とARE:エージェント研究をコミュニティに開放する新ベンチマークとフレームワーク
Gaia2 and ARE: Empowering the community to study agents
Metaは、より複雑なエージェントの挙動を分析できる新しいベンチマーク「Gaia2」と、エージェントの実行、デバッグ、評価を可能にするオープンフレームワーク「ARE (Agent Research Environments)」を発表した。Gaia2は、以前のGAIAベンチマークを発展させ、読み取りだけでなく書き込みも可能で、曖昧または時間的制約のあるクエリに対する指示追従、失敗が制御されたノイズの多い環境での複雑なタスク管理、APIの失敗への対応、複数アクションの計画、新イベントへの適応といった、より現実世界に近い条件でのエージェントのインタラクティブな挙動と複雑性管理に焦点を当てている。Gaia2は1000個の新規シナリオからなるタスクグループ(実行、検索、曖昧性処理、適応性、時間推論、エージェント間協調、ノイズ耐性)で構成される。AREは、エージェントが様々なアプリケーションやツールにアクセスできるスマートフォンモックアップ環境を提供し、エージェントの全てのインタラクションは構造化されたトレースとして記録・エクスポート可能である。GPT-5、Kimi K2、Llama 3.3-70B Instruct、GPT-4oなど多数のモデルが評価され、2025年9月時点でGPT-5が最高スコア、Kimi K2が最優秀オープンソースモデルとなった。特に、曖昧性、適応性、ノイズ耐性、時間推論のタスクは依然としてモデルにとって挑戦的であることが示された。Gaia2とAREは、透明性、再現性、デバッグ可能なトレースを通じて、より信頼性が高く適応性のあるAIエージェントの開発を促進することを目指している。
- MetaがAIエージェント向け新ベンチマーク「Gaia2」とオープンフレームワーク「ARE」を発表
- Gaia2の評価でGPT-5が最高スコア、Kimi K2が最優秀オープンソースモデルを獲得
Metaが新たに発表したGaia2ベンチマークとAREフレームワークは、AIエージェントの性能評価を現実世界の複雑性に近づける試みであり、信頼性・適応性の高いエージェント開発競争を加速させる。GPT-5がトップ、Kimi K2が最優秀オープンソースモデルという結果は、クローズドvsオープンソースのエージェント性能比較の指標として投資判断に有用。特に曖昧性処理や時間推論といった課題が依然としてモデルにとって困難である点は、差別化技術を持つスタートアップへの投資機会を示唆している。