Asayomu Tech
注目★★★★Hugging Face Papers

StepAudio 3 Realtime、発話中推論で自然な全二重対話

30秒で把握

  • 1StepFun が StepAudio 3 Realtime 発表、発話中の並行推論を実現
  • 2MMSU 90.6、Full-Duplex Bench Overall 98.9を達成
  • 3τ-Voice のタスク成功率56.0%、非同期ツール実行にも対応

要約

StepFun は音声言語基盤モデル「StepAudio 3 Realtime」を発表した。連続的な listen-converse-think-act ループと、音響情報を捉える Deep Perception、同期音声を扱う Seamless Duplex を備える。Think-While-Speaking により、発話しながら内部推論を並行実行し、応答の深さとリアルタイム性を両立する。StepAudioChat の推論モードで macro average 73.0、MMSU で 90.6、Artificial Analysis Full-Duplex Bench で Overall 98.9、τ-Voice で macro task-success rate 56.0% を達成した。統合 Voice Agent は対話を中断せず非同期でツールを実行する。

あなたへの影響

音声UIやVoice Agentを開発するチームは、割り込み・相づち・発話中推論を含む対話品質を評価軸に加え、StepAudio 3 Realtimeのベンチマーク結果を次スプリントで検証する価値がある。

推奨:Think-While-Speakingは、音声出力と内部推論を並行する方式を指す。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。