注目★★★★★Hacker News
Apple の新音声認識 API、Whisper を上回る精度と速度を実測
30秒で把握
- 1Apple の SpeechAnalyzer が Whisper Small を英語精度で上回り、演算時間は 3 分の 1 に短縮
- 2前世代 API との比較で WER が 3.5~4 倍削減、クリーン環境で 2.12%・ノイズ環境で 4.56% を実現
- 3多言語は Whisper(100+ 言語)、英語は SpeechAnalyzer(iOS/Mac)を使い分けるのが最適選定
要約
Apple の新 API「SpeechAnalyzer」は LibriSpeech ベンチマークで Whisper Small を精度・速度ともに上回り、前世代の SFSpeechRecognizer からは WER(単語誤り率)を 3.5~4 倍削減した。クリーンな音声で 9.02% から 2.12% へ、ノイズ環境で 16.25% から 4.56% へ低下し、Whisper Small の 3 分の 1 の演算量で動作する。Inscribe の開発チームが 5,559 の音声ファイルで検証し、OpenAI の公開数値と一致を確認したため再現性が高い。英語の on-device 音声認識では現在、Apple プラットフォーム上で SpeechAnalyzer が最強の選択肢となった。
あなたへの影響
iOS/macOS アプリで SFSpeechRecognizer を使用中のチームは SpeechAnalyzer への移行を急ぐべき。
推奨:ただし SpeechTranscriber は約 30 言語に限定され、Whisper は 100+ 言語に対応するため、多言語アプリは言語ごとに最適エンジンを選ぶ必要がある。