Holo3.1: 高速かつローカルで利用可能なコンピューター利用エージェント
Holo3.1: Fast & Local Computer Use Agents
Holo3.1は、Web、デスクトップ、モバイル環境、エージェントフレームワーク、クラウド推論からローカル実行まで、多様なデプロイメントターゲットに対応するコンピューター利用エージェントのファミリーです。Qwenファミリーをベースに、実環境での堅牢性を向上させ、最先端のパフォーマンスを維持しています。特に、ローカル推論用に最適化されたFP8、Q4 GGUF、NVFP4の量子化チェックポイントが初めてリリースされました。AndroidWorldでの35B-A3Bモデルの性能は67%から79.3%に向上し、4Bおよび9Bモデルも58%から72%に改善しました。また、関数呼び出しプロトコルへのネイティブサポートが追加され、構造化JSON出力と合わせて利用可能です。ローカルおよびオンデバイス推論をさらに促進するため、0.8B、4B、9Bの小型モデルと35B-A3Bの大型モデルが提供されます。NVFP4 W4A16は、FP8と比較してDGX Sparkで1.41倍、BF16と比較して1.74倍のスループットを実現します。エージェントはローカルマシンで実行され、モデルはローカルマシンまたは同一ネットワーク上のDGX Sparkで実行可能で、プライバシーが保護されます。
- Qwenベースのコンピューター利用エージェントファミリーHolo3.1がリリースされた
- NVFP4量子化チェックポイントが初めて公開され、ローカル推論が高速化された
- AndroidWorldでの35B-A3Bモデルの性能が67%から79.3%に向上した
- 関数呼び出しプロトコルへのネイティブサポートが追加された
Holo3.1は、ローカル環境でのAIエージェント実行を現実的な選択肢とする点で注目に値する。特にNVFP4量子化による推論高速化(BF16比1.74倍)や、0.8B〜35Bまでの幅広いモデルラインナップは、エッジデバイスやプライベートクラウドでのエージェント展開を促進し、AIインフラの分散化・民主化を加速させる。プライバシー保護を前提としたオンデバイスAIの実用化が進むことで、従来のクラウド集中型AIビジネスモデルに構造変化をもたらす可能性があり、関連するエッジAI/オンデバイス推論市場の成長を牽引する技術動向として注目すべき。