Asayomu Tech
注目★★★★Hugging Face Papers

StepAudio 3 Music、5分30秒の音楽生成を実現

30秒で把握

  • 1StepFun が StepAudio 3 Music 発表、最大5分30秒の長尺生成に対応
  • 250Hz・65,536コードブックとDiTで48kHz音声を生成
  • 3ABC-CoTで和声・リズム・旋律を計画しQuality Elo 1105を獲得

要約

StepFun は長尺音楽生成モデル StepAudio 3 Music を発表し、明示的な音楽構成計画とオープンドメインのテキスト制御に対応した。音声を50Hz・65,536エントリの単一コードブックで表現し、DiTがVAE潜在表現を予測して48kHz音声に変換する。ABC記譜法による中間アレンジ計画で和声・リズム・旋律を生成コンテキストに組み込み、楽曲・インストゥルメンタル、ボーカルからの伴奏、カバー曲を最大5分30秒生成できる。DPO学習後のモデルは複数のAudioBox評価とMuQ-MuLan類似度で最高スコアを獲得し、Music Arena VocalsではQuality Elo 1105でSuno V5.5とMurekaに次ぐ結果だった。

あなたへの影響

音楽生成基盤を評価する日本の開発チームは、ABC-CoTによる計画性、最大5分30秒の生成、48kHz出力を検証対象に含めるべきです。

推奨:公開範囲や推論要件は本文だけでは確定しないため、導入前にモデル提供形態とライセンスを確認してください。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。