Smol2Operator: トレーニング後のGUIエージェントによるコンピューター操作
Smol2Operator: Post-Training GUI Agents for Computer Use
本記事では、GUI自動化のためのビジョン・言語モデル(VLM)のトレーニングに焦点を当てた「Smol2Operator」というアプローチを紹介する。このアプローチは、多段階のトレーニング戦略を採用し、ゼロからGUI操作能力を持つエージェントを育成する。まず、AGUVIS論文に着想を得て、オープンソースのデータセット(xlangai/aguvis-stage1, xlangai/aguvis-stage2)を統一されたアクション空間に変換するデータ変換パイプラインを構築した。このパイプラインは、関数解析と正規化、アクション空間の統一、そしてユーザーが独自のアクションボキャブラリーに適応できる柔軟なフレームワークを提供する。次に、2段階のトレーニングプロセスを実行する。フェーズ1では、SmolVLM2-2.2B-InstructモデルにGUIのグラウンディング能力を付与するため、smolagents/aguvis-stage-1データセットを用いてファインチューニングを行う。この段階で、画像サイズ1152px、正規化座標(0-1範囲)が最適であることが判明し、ScreenSpot-v2ベンチマークで41%の性能向上を達成した。フェーズ2では、smolagents/aguvis-stage-2データセットを用いて、エージェントの推論能力を強化する。これにより、ScreenSpot-v2の精度は61%に向上した。本研究では、トレーニングコード、データセット、モデルをすべてオープンソースとして公開しており、GUIエージェント開発の進展を促進することを目指している。
- Smol2OperatorというGUIエージェントトレーニング手法が公開された
本記事は、GUIエージェント(コンピュータ操作を自動化するAI)のトレーニング手法「Smol2Operator」をオープンソースで公開した点が重要。従来のGUIエージェントは大規模な商用モデルに依存していたが、2.2Bパラメータの小型モデル(SmolVLM2)を基盤に、ゼロからのトレーニングでScreenSpot-v2ベンチマークで61%精度を達成したことは、低コスト・軽量なエージェント実装の可能性を示す。トレーニングコード・データセット・モデルをすべて公開したことで、コミュニティによる応用開発が加速し、企業の業務自動化やRPA分野への影響が期待される。エンタープライズSaaSやAIエージェントスタートアップの競争環境に変化をもたらす可能性があるため、注目に値する。