smolagentsがビジョン言語モデル(VLM)をサポートし、エージェントパイプラインでの活用を可能に
We now support VLMs in smolagents!
smolagentsがビジョンサポートを追加し、エージェントパイプラインでビジョン言語モデル(VLM)をネイティブに利用可能になった。これにより、ウェブブラウジングのような、視覚情報が重要なタスクにおいてエージェントの能力が向上する。画像は、エージェント開始時に直接渡すか、ウェブブラウザの例のように動的に追加することができる。動的な画像追加は、`agent.step_callbacks` を使用して実装され、`ActionStep` の `observations_images` 属性に画像を追加することで実現される。記事では、ウェブブラウザエージェントを構築するために `helium` ライブラリと連携し、スクリーンショットを撮って `observations_images` に保存する `save_screenshot` コールバック関数を作成する例が示されている。また、`search_item_ctrl_f`、`go_back`、`close_popups` といった新しいツールも紹介されている。Qwen2VL-72Bのような強力なVLMを使用することで、より高度なエージェント機能が期待できる。
- smolagentsがビジョン言語モデル(VLM)のネイティブサポートを追加し、エージェントパイプラインで画像を直接扱えるようになった
smolagentsがVLMをネイティブサポートしたことで、視覚情報を活用したエージェントのタスク実行能力が飛躍的に向上する。特にウェブブラウジングのようなUI操作を伴う領域では、従来のテキストベースのエージェントでは難しかった画面認識・操作が可能になり、AIエージェントの適用範囲が広がる。Qwen2VL-72Bのような高性能VLMとの組み合わせにより、エンタープライズ業務自動化やRPA代替としての需要が拡大する可能性があり、関連スタートアップや基盤モデル提供企業への投資機会につながる。