Asayomu Tech
注目★★★★Hugging Face Papers

AuK、音声生成と編集を統合するOSS基盤モデルを公開

30秒で把握

  • 1AuKが自然言語指示で音声生成と5領域の編集を統合
  • 2約30.3億件・195万時間で学習しソースコードと重みを公開
  • 3AuK-Flashは4ステップ推論でフルモデル比4.5倍高速化

要約

AuKは、自然言語指示と音声コンテキストで音声生成・編集を統合するオープンソース基盤モデルを公開した。音声生成、内容編集、強調・分離、パラ言語編集、音響編集の5領域で、約30.3億件のinstruction-audio事例と195万時間の実効教師信号を用いて学習した。マルチモーダルLLM、音声・一般音声・音楽で共同学習したVAE、ハイブリッドrectified-flow Transformerを組み合わせる。蒸留版AuK-Flashはclassifier-free guidanceなしの4ステップ推論に対応し、同条件でフルモデル比4.5倍の実時間速度を達成した。ソースコードとモデル重みを公開した。

あなたへの影響

音声生成・編集を開発する日本のエンジニアは、公開されたモデル重みとコードでAuK-Flashの品質、推論コスト、対象タスクへの適合性を次スプリントで検証するとよい。

推奨:AuK-Flashは4ステップ推論で高速化する蒸留モデルである。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。