Ecom-RLVE: Eコマース対話エージェントのための適応型検証可能環境
Ecom-RLVE: Adaptive Verifiable Environments for E-Commerce Conversational Agents
本研究では、RLVEフレームワークを単一ターンの推論パズルから、マルチターンのツール拡張型Eコマース対話へと拡張したEcomRLVE-GYMを提案する。EcomRLVE-GYMは、製品発見、代替品提案、カート構築、返品、注文追跡、ポリシーQA、バンドル計画、マルチインテントジャーニーの8つの検証可能な環境を提供し、それぞれに手続き的な問題生成、12軸の難易度カリキュラム、アルゴリズム的に検証可能な報酬を備えている。Qwen 3 8BモデルをDAPOを用いて300ステップで学習させ、環境スケーリングと適応的難易度がエージェントの現実世界タスク完了に転移することを示す初期結果を発表した。このフレームワークは、顧客サービスの結果を構造的に検証可能にし、人間のアノテーションやLLMによる判定を不要にする。各環境は、タスク報酬、効率性報酬、ハルシネーションペナルティの3つの報酬シグナルを使用し、12の独立した側面から難易度を制御する。Qwen 3 8BモデルをC1(カート構築)で300ステップ学習させた結果、適応的スケジューリングが安定した学習シグナルを生み出すことを確認した。
- EcomRLVE-GYMフレームワークを発表。Eコマース対話エージェント向けに8つの検証可能な環境を提供
- Qwen 3 8BモデルをDAPOを用いてC1(カート構築)環境で300ステップ学習させ、適応的難易度スケジューリングの有効性を確認
本稿で提案されたEcomRLVE-GYMフレームワークは、Eコマース対話AIエージェントの学習において、手続き的タスク生成と検証可能な報酬設計により、人間のアノテーションやLLMジャッジを不要にする点がユニーク。特に、カート構築や返品処理など実際のカスタマーサービスタスクを8環境でカバーし、Qwen 3 8Bという小型モデルでもDAPOによる強化学習が有効に機能した点は、カスタマーサポート自動化のコスト構造を大きく変える可能性を示唆する。適応的難易度カリキュラムによる安定した学習シグナルは、実用化への重要なマイルストーンであり、AI×カスタマーサービス領域のスタートアップや既存プラットフォーム企業にとって競争優位に直結する技術要素と見られる。