Asayomu Tech
注目★★★★★Hacker News

Qwen3-TTS、単一 H100 で 50ms 以下の応答・毎秒 10 リクエスト処理実現

30秒で把握

  • 1Qwen3-TTS 1.7B を 3 モジュール統一スケジューラで最適化・p95 TTFA 50ms 以下 + 10 RPS 達成
  • 2毎秒 630 文字生成で $2/M 文字 (商用比 50-50 倍コスト削減・遅延は 2-20 倍短縮)
  • 3実装・ベンチマーク・方法論をオープンソース公開・他 TTS エンジン 5 種の比較結果も開示

要約

Qwen3-TTS 1.7B CustomVoice を最適化し、単一 NVIDIA H100 SXM 上で p95 時間到達 (TTFA) を 50ms 以下に抑えながら毎秒 10 リクエスト処理を実現した。毎秒 630 文字生成でコストは 1M 文字あたり約 $2 であり、ElevenLabs V3 ($100/M) や Cartesia Sonic 3.5 ($49/M) より大幅に低い。最適化の核は、Talker・Code Predictor・Codec の 3 モジュールを統一スケジューラ下に配置し、優先度ベースで作業を割り当てることと、Code Predictor は CUDA グラフ化・Codec は状態キャッシュで段階的デコードを使うこと。実装とベンチマークはオープンソース化された。

あなたへの影響

自社で TTS を運用するチームは、本実装がコスト・遅延・スケーラビリティの新基準を示しているため。

推奨:既存サービスプロバイダ (ElevenLabs 等) との契約条件と比較検討し、必要に応じてオープンソース実装の評価を検討する価値がある。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。