Asayomu Tech
最重要★★★★★DeepMind

Gemini 3.8 TTS、声を無限に設計できる音声生成

30秒で把握

  • 1Google が Gemini 3.8 Flash TTS と Flash-Lite TTS を公開
  • 2100超言語・2,000以上の声・30秒サンプル複製に対応
  • 3SynthID と同意確認を採用し API と AI Studio で提供開始

要約

Google は Gemini 3.8 Flash TTS と Flash-Lite TTS を公開し、自然言語で声を設計しながら行単位で演技を制御できる音声生成を実現した。Flash TTS は100超の言語・方言に対応し、2,000以上の音声ライブラリと30秒の音声サンプルによる声の複製を提供する。音声複製には同意確認を必須とし、生成音声には SynthID の透かしと C2PA 認証情報を付与する。Flash TTS は Hume AI の Voice Design Benchmark で71.4点、アクセントモデリングで60.8点を獲得し、総合品質指標では Flash TTS と Flash-Lite TTS がそれぞれ1位と2位になった。両モデルは Gemini API と Google AI Studio で提供を開始し、Flash TTS は Gemini Notebook、Flash-Lite TTS は Google Vids にも展開する。

あなたへの影響

音声アプリや多言語コンテンツを開発する日本のチームは、Gemini API と Google AI Studio で日本語の品質、声の複製、同意確認の運用を今すぐ検証すべき。

推奨:SynthID は生成音声に埋め込む検出用透かしで、C2PA はコンテンツの来歴情報を扱う標準仕様。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。