注目★★★★★Hugging Face Papers
StepAudio 3 Realtime、発話中推論で自然な全二重対話
30秒で把握
- 1StepFun が StepAudio 3 Realtime 発表、発話中の並行推論を実現
- 2MMSU 90.6、Full-Duplex Bench Overall 98.9を達成
- 3τ-Voice のタスク成功率56.0%、非同期ツール実行にも対応
要約
StepFun は音声言語基盤モデル「StepAudio 3 Realtime」を発表した。連続的な listen-converse-think-act ループと、音響情報を捉える Deep Perception、同期音声を扱う Seamless Duplex を備える。Think-While-Speaking により、発話しながら内部推論を並行実行し、応答の深さとリアルタイム性を両立する。StepAudioChat の推論モードで macro average 73.0、MMSU で 90.6、Artificial Analysis Full-Duplex Bench で Overall 98.9、τ-Voice で macro task-success rate 56.0% を達成した。統合 Voice Agent は対話を中断せず非同期でツールを実行する。
あなたへの影響
音声UIやVoice Agentを開発するチームは、割り込み・相づち・発話中推論を含む対話品質を評価軸に加え、StepAudio 3 Realtimeのベンチマーク結果を次スプリントで検証する価値がある。
推奨:Think-While-Speakingは、音声出力と内部推論を並行する方式を指す。