Asayomu Tech
最重要★★★★★Hacker News

Gemini 3.8 TTS、声をゼロから設計して演技まで指示

30秒で把握

  • 1Google が Gemini 3.8 Flash TTS と Flash-Lite TTS を公開
  • 2100 超の言語・方言、2,000 超の音声、30 秒音声複製に対応
  • 3API と AI Studio で提供開始、Notebook と Vids にも展開

要約

Google は Gemini 3.8 Flash TTS と Flash-Lite TTS を公開し、自然言語で声の設計や台詞ごとの演技指示ができるようにした。Flash TTS は 100 超の言語・方言に対応し、2,000 超の音声ライブラリ、30 秒の音声サンプルによる声の複製、長時間音声と2話者シーンの生成を提供する。Flash TTS は Hume AI の Voice Design Benchmark で 71.4 点、アクセントモデリングで 60.8 点を獲得し、総合品質指標で Flash TTS と Flash-Lite TTS がそれぞれ 1 位と 2 位になった。両モデルは Gemini API と Google AI Studio で提供を開始し、Flash TTS は Gemini Notebook、Flash-Lite TTS は Google Vids にも展開する。声の複製には所有者の同意確認を求め、生成音声には SynthID を埋め込む。

あなたへの影響

音声UIや多言語コンテンツを開発する日本のチームは、Gemini API と Google AI Studio で日本語の品質、料金、長時間生成、声の複製同意フローを近日中に検証すべきです。

推奨:SynthIDは生成音声に埋め込む不可視の透かしで、運用時の検出性を高めます。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。