Intel® CoreTM Ultra上でQwen3-8BエージェントをDepth-Pruned Draftモデルで高速化
Accelerating Qwen3-8B Agent on Intel® Core™ Ultra with Depth-Pruned Draft Models
Intelは、OpenVINO.GenAIと軽量なQwen3-0.6Bドラフトモデルを用いた投機的デコーディングにより、Qwen3-8Bモデルの生成速度を約1.3倍に高速化しました。さらに、ドラフトモデルの層を6つ削減(Depth-Pruning)しファインチューニングを行うことで、速度を約1.4倍に向上させました。この技術は、Intel® CoreTM Ultraプロセッサ上で動作するローカルAIエージェントの応答性を高め、🤗smolagents、AutoGen、QwenAgentなどのフレームワークと連携して、API呼び出しやコード実行、長文推論などの複雑なタスクを効率的に実行可能にします。この最適化されたモデルは、AI PC上での実用的なAIエージェントの実現に貢献します。
- IntelがOpenVINO.GenAIとQwen3-0.6Bドラフトモデルを用いた投機的デコーディングにより、Qwen3-8Bモデルの生成速度を約1.3倍に高速化したことを発表
- Intelがドラフトモデルの層を6つ削減しファインチューニングを行うDepth-Pruning技術により、生成速度を約1.4倍に向上させたことを発表
Intelが自社のCore Ultraプロセッサ上でQwen3-8Bエージェントの推論を高速化した点は、AI PC市場におけるIntelの競争力強化につながる。特にDepth-Pruningによるドラフトモデル軽量化で約1.4倍の高速化を達成したことは、エッジAI/ローカルAIエージェントの実用性を高め、AI PCの普及促進に寄与する。IntelはOpenVINO.GenAIエコシステムを通じて、AI PC向けソフトウェア最適化でも存在感を示しており、半導体メーカーとしてのバリューチェーン上流からの影響力強化が期待される。