最重要★★★★★DeepMind
Gemini 3.8 Live登場、音声AIが会話中に推論・実行
30秒で把握
- 1GoogleがGemini 3.8 Live系2モデルを公開し音声推論を強化
- 2Extended Thinkingが音声品質82.6、τ-Voiceで68.6%を記録
- 397言語切替と会話中のAPI実行、SynthID透かしに対応
要約
GoogleはGemini 3.8 LiveとGemini 3.8 Live Extended Thinkingを公開し、音声エージェント向けの近リアルタイム推論を強化した。Extended ThinkingはSpeech to Speech Quality Indexで82.6、τ-Voiceで68.6%、Big Bench Audioで97.7%を記録した。3.8 Liveは視覚入力、会話中の97言語切り替え、会話を続けながらのツール実行とAPI呼び出しに対応する。Extended Thinkingは発話しながら複雑な多段階タスクを推論し、進捗も音声で伝える。両モデルはGemini APIとGoogle AI Studioで提供を開始し、企業向けやSearch、Geminiアプリにも順次展開する。音声出力にはSynthID透かしを埋め込む。
あなたへの影響
音声エージェントを開発・導入する日本のチームは、Gemini APIで遅延、ツール呼び出し、継続対話の実運用検証を次スプリントで行うべきです。
推奨:SynthIDはAI生成音声を検出可能にする透かし技術です。