Appleの新しいSpeechAnalyzer API、Whisperおよび前世代と比較したベンチマーク結果
Apple's new SpeechAnalyzer API, benchmarked against Whisper and its predecessor
AppleはiOS 26およびmacOS 26で、音声認識APIをSFSpeechRecognizerからSpeechAnalyzerとSpeechTranscriberに刷新した。新しいSpeechAnalyzer APIは、オンデバイスでの音声認識において、テストした全てのWhisperモデル(Whisper Smallを含む)よりも高い精度を示し、特にクリーンな音声ではWhisper Tinyよりも優れていた。また、Whisper Smallと比較して約3倍高速に動作する。旧APIであるSFSpeechRecognizerは、クリーンな音声認識において最も低い精度となった。このベンチマークは、Apple M2 Pro(32GB、macOS 26.5.1)上で、LibriSpeechデータセット(cleanとnoisyの両方)を用いて実施された。SpeechAnalyzerは、精度と速度の両面でWhisperを上回る結果となったが、Whisperはより多くの言語をサポートし、Appleプラットフォーム以外でも動作するという利点を持つ。記事の著者は、この結果を受けて自社製品Inscribeのデフォルト設定をSpeechAnalyzerに変更した。ただし、このベンチマークは英語の読み上げ音声に限定されており、会議音声などへの適用性は今後の検証課題である。
- AppleがiOS 26/macOS 26で音声認識APIをSpeechAnalyzer/Transcriberに刷新し、オンデバイス精度でWhisper Smallを含む全Whisperモデルを上回った
- SpeechAnalyzerはWhisper Small比で約3倍高速に動作する
- 旧APIのSFSpeechRecognizerはクリーン音声認識で最も低い精度だった
Appleが独自開発したオンデバイス音声認識API「SpeechAnalyzer」が、精度と速度の両面でOpenAIのWhisper Smallを上回るベンチマーク結果を示した点は注目に値する。これはAppleがAI/ML領域で自社シリコンとソフトウェアスタックの垂直統合を活かし、競合に対して差別化可能な性能を実現しつつあることを示唆している。ただし、ベンチマークは英語の読み上げ音声のみで、会議音声や多言語対応など実用的なユースケースでの検証は未完了である点には留意が必要。エコシステム内でのAI機能の高度化は、Appleのサービス収益や端末アップグレードサイクルに影響を与える中期的なテーマである。