最重要★★★★★Hacker News
Gemini 3.8 TTS、声をゼロから設計して演技まで指示
30秒で把握
- 1Google が Gemini 3.8 Flash TTS と Flash-Lite TTS を公開
- 2100 超の言語・方言、2,000 超の音声、30 秒音声複製に対応
- 3API と AI Studio で提供開始、Notebook と Vids にも展開
要約
Google は Gemini 3.8 Flash TTS と Flash-Lite TTS を公開し、自然言語で声の設計や台詞ごとの演技指示ができるようにした。Flash TTS は 100 超の言語・方言に対応し、2,000 超の音声ライブラリ、30 秒の音声サンプルによる声の複製、長時間音声と2話者シーンの生成を提供する。Flash TTS は Hume AI の Voice Design Benchmark で 71.4 点、アクセントモデリングで 60.8 点を獲得し、総合品質指標で Flash TTS と Flash-Lite TTS がそれぞれ 1 位と 2 位になった。両モデルは Gemini API と Google AI Studio で提供を開始し、Flash TTS は Gemini Notebook、Flash-Lite TTS は Google Vids にも展開する。声の複製には所有者の同意確認を求め、生成音声には SynthID を埋め込む。
あなたへの影響
音声UIや多言語コンテンツを開発する日本のチームは、Gemini API と Google AI Studio で日本語の品質、料金、長時間生成、声の複製同意フローを近日中に検証すべきです。
推奨:SynthIDは生成音声に埋め込む不可視の透かしで、運用時の検出性を高めます。