注目★★★★★Hacker News
Qwen3-TTS、単一 H100 で 50ms 以下の応答・毎秒 10 リクエスト処理実現
30秒で把握
- 1Qwen3-TTS 1.7B を 3 モジュール統一スケジューラで最適化・p95 TTFA 50ms 以下 + 10 RPS 達成
- 2毎秒 630 文字生成で $2/M 文字 (商用比 50-50 倍コスト削減・遅延は 2-20 倍短縮)
- 3実装・ベンチマーク・方法論をオープンソース公開・他 TTS エンジン 5 種の比較結果も開示
要約
Qwen3-TTS 1.7B CustomVoice を最適化し、単一 NVIDIA H100 SXM 上で p95 時間到達 (TTFA) を 50ms 以下に抑えながら毎秒 10 リクエスト処理を実現した。毎秒 630 文字生成でコストは 1M 文字あたり約 $2 であり、ElevenLabs V3 ($100/M) や Cartesia Sonic 3.5 ($49/M) より大幅に低い。最適化の核は、Talker・Code Predictor・Codec の 3 モジュールを統一スケジューラ下に配置し、優先度ベースで作業を割り当てることと、Code Predictor は CUDA グラフ化・Codec は状態キャッシュで段階的デコードを使うこと。実装とベンチマークはオープンソース化された。
あなたへの影響
自社で TTS を運用するチームは、本実装がコスト・遅延・スケーラビリティの新基準を示しているため。
推奨:既存サービスプロバイダ (ElevenLabs 等) との契約条件と比較検討し、必要に応じてオープンソース実装の評価を検討する価値がある。