Speculative DecodingによるWhisper推論の2倍高速化
Speculative Decoding for 2x Faster Whisper Inference
この記事では、音声認識モデルWhisperの推論速度を2倍にする「Speculative Decoding」という手法を紹介しています。Speculative Decodingは、高速なアシスタントモデルが生成した候補トークンを、より精度の高いメインモデルで検証することで、推論時間を短縮します。この手法は、メインモデル単体で使用した場合と数学的に全く同じ出力を保証するため、既存のWhisperパイプラインにそのまま導入できるドロップイン代替となります。実験では、Whisper large-v2モデルとdistil-large-v2をアシスタントモデルとして使用した場合、推論時間が73秒から33秒に短縮され、Word Error Rate (WER) は3.5%で同等でした。また、多言語対応としてWhisper tinyをアシスタントモデルとして使用した場合でも、オランダ語の音声認識で推論時間が117秒から62秒に短縮され、WERは12.8%で同等でした。バッチサイズが4を超えると速度低下が見られるため、バッチサイズ1が最も効果的です。
- Speculative Decoding手法によりWhisper large-v2の推論時間を73秒から33秒に短縮、WERは3.5%で同等であることが実証された
- 多言語設定でWhisper tinyをアシスタントモデルとして使用し、オランダ語音声認識の推論時間を117秒から62秒に短縮、WERは12.8%で同等であることが示された
Whisperの推論を2倍高速化するSpeculative Decodingは、メインモデルの出力精度を完全に維持しながら推論コストを半減できる。バッチサイズ1で最も効果が高い特性から、低レイテンシが求められるリアルタイム音声認識(会議文字起こし、音声アシスタント、字幕生成など)の導入障壁を大きく下げる。特にWhisper tinyをアシスタントに使う多言語対応は、言語ごとに専用モデルを用意せずに高速化できる点で実用的価値が高い。Whisperベースのサービスを提供する企業にとっては、GPUコスト削減に直結するため、競争力向上につながる可能性がある。