Asayomu Tech
最重要★★★★★DeepMind

Gemini 3.5 Transcribe、音声認識の精度 WER 2.6% で業界最高水準・85言語対応

30秒で把握

  • 1Google が Gemini 3.5 Transcribe を公開・WER 2.6% (非ストリーミング) で前世代比 70% 低レイテンシ達成
  • 285 言語対応・ノイズ環境の認識性能向上・複数話者認識で多言語・マルチパーティ運用が現実化
  • 3Gemini API (リアルタイム / 事前録音) と Google 製品統合で、開発者は音声エージェント・字幕・分析パイプラインの構築が可能に

要約

Google は Gemini 3.5 Transcribe を発表し、最高精度の音声文字化モデルを提供開始した。ストリーミング時 WER 4.0%、非ストリーミング時 WER 2.6% を達成し、前世代 Chirp 3 比で応答時間 70% 短縮した。ノイズの多い環境でも郵便番号など英数字を正確に認識し、85 言語以上を自動検出・支援する。開発者は Gemini API 経由でリアルタイムストリーミング (Live API) と事前録音音声処理 (Interactions API) の 2 つの API で、音声エージェント・リアルタイム字幕・通話後分析を構築でき、Gboard・Gemini アプリ・Chrome 等の Google 製品にも統合される。

あなたへの影響

WER 2.6% (非ストリーミング) と高精度を実現し、ノイズ環境や複数言語での運用が現実的になった。

推奨:日本語ユーザーも含まれる 85 言語対応により、多言語カスタマーサポート・議事録自動作成等の実装チームは試験導入を始め、精度・レイテンシ・コストを既存 STT サービスと比較して選定の可否を判断すべき。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。