EVA-Bench Data 2.0: 3ドメイン、121ツール、213シナリオ
EVA-Bench Data 2.0: 3 Domains, 121 Tools, 213 Scenarios
EVA-Benchは、音声エージェントの評価ベンチマークを拡張し、従来のエンタープライズドメインから、航空カスタマーサービス管理(CSM)、エンタープライズITサービス管理(ITSM)、ヘルスケアHRサービスデリバリー(HRSD)の3つのドメインに拡大しました。これにより、121のツールと213の評価シナリオを網羅し、以前のリリースから約4倍のカバレッジとなりました。各シナリオは、OpenAI GPT-5.4、Google Gemini 3.1 Pro、Anthropic Claude Opus 4.6の3つの最先端モデルで検証され、ベンチマークの挑戦性と公平性が保証されています。これらのデータセットはオープンソースで提供され、Hugging Faceからダウンロード可能です。EVA-Benchは、音声エージェントの評価、および評価データセット構築のための実践的なリファレンスとして設計されており、将来的な多言語拡張も予定されています。データセット生成には、SyGraというグラフベースの合成データ生成パイプラインが使用され、ユーザーゴール、初期シナリオデータベース、期待される最終データベース状態の3つのコンポーネントが共同で生成され、一貫性が確保されています。生成後、構造チェック、LLMベースのバリデーター、LLMベースのトレース検証といった多段階の検証ループと、手動レビューを経て、最終的なデータセットが構築されています。これにより、音声エージェントが現実世界の多様なエンタープライズシナリオでどのように機能するかを評価するための、より包括的で信頼性の高いベンチマークが提供されます。
- EVA-Benchの評価データセットが3ドメイン(航空CSM、エンタープライズITSM、ヘルスケアHRSD)、121ツール、213シナリオに拡張され、オープンソースで公開された
EVA-Benchのデータセット拡張は、音声エージェントの評価基盤が急速に発展していることを示す。特にエンタープライズ領域(航空CSM・ITSM・HRSD)に特化した213シナリオを用意し、主要な最新LLM(GPT-5.4, Gemini 3.1 Pro, Claude Opus 4.6)で検証済みという点は、音声AIスタートアップやエージェント型SaaSの差別化指標として業界標準化する可能性がある。SyGraパイプラインによる合成データ生成手法も、類似の評価データセット市場への展開余地を示唆しており、関連スタートアップへの投資機会の目印になる。