H Company、高スループットなコンピューター利用エージェントモデル「Holotron-12B」を発表
Holotron-12B - High Throughput Computer Use Agent
H Companyは、NVIDIA Nemotron-Nano-2 VLモデルを基盤とし、独自のデータセットで追加学習させたマルチモーダルコンピューター利用モデル「Holotron-12B」をリリースしました。このモデルは、従来の指示追従モデルとは異なり、インタラクティブな環境で効率的に知覚、判断、行動するコンピューター利用エージェントのポリシーモデルとして機能することを目指しています。Holotron-12Bは、ハイブリッドな状態空間モデル(SSM)とアテンションメカニズムを組み合わせたNemotronアーキテクチャを採用しており、特に長文脈や複数画像を扱う際の推論効率とスループットが大幅に向上しています。WebVoyagerベンチマークでは、Holo2-8Bと比較して2倍以上のスループットを達成し、100のベンチマークワーカーが同時に実行される環境下でも、最大で毎秒8.9kトークンという高いスループットを示しました。これは、SSMがKVキャッシュのようなトークンごとの状態を保存する必要がなく、シーケンス長に依存しない定数状態のみを保存するため、メモリフットプリントが削減されることに起因します。Holotron-12Bは、約140億トークンで学習され、WebVoyagerベンチマークでの性能は35.1%から80.5%に向上しました。H Companyは、このモデルをHugging Faceで公開しており、今後はNemotron 3 Omniへと進化させ、さらなる推論能力とマルチモーダル精度向上を目指すとしています。
- H Companyがマルチモーダルコンピューター利用エージェントモデル「Holotron-12B」を公開
H Companyが公開したHolotron-12Bは、SSMとアテンションのハイブリッドアーキテクチャにより、コンピューター利用エージェントの推論効率とスループットを大幅に向上させた点が注目に値する。特にKVキャッシュ不要でシーケンス長非依存の定数状態のみ保存する設計は、多数のエージェントを同時稼働させるユースケースでのメモリコスト削減につながり、エージェントの実運用コストを劇的に引き下げる可能性がある。WebVoyagerベンチマークで性能が35.1%から80.5%へ急伸した点も、単なる効率改善ではなく精度も両立している証左であり、今後のNemotron 3 Omniへの発展が競争力強化の鍵となる。