注目★★★★★Hugging Face Papers
AuK、音声生成と編集を統合するOSS基盤モデルを公開
30秒で把握
- 1AuKが自然言語指示で音声生成と5領域の編集を統合
- 2約30.3億件・195万時間で学習しソースコードと重みを公開
- 3AuK-Flashは4ステップ推論でフルモデル比4.5倍高速化
要約
AuKは、自然言語指示と音声コンテキストで音声生成・編集を統合するオープンソース基盤モデルを公開した。音声生成、内容編集、強調・分離、パラ言語編集、音響編集の5領域で、約30.3億件のinstruction-audio事例と195万時間の実効教師信号を用いて学習した。マルチモーダルLLM、音声・一般音声・音楽で共同学習したVAE、ハイブリッドrectified-flow Transformerを組み合わせる。蒸留版AuK-Flashはclassifier-free guidanceなしの4ステップ推論に対応し、同条件でフルモデル比4.5倍の実時間速度を達成した。ソースコードとモデル重みを公開した。
あなたへの影響
音声生成・編集を開発する日本のエンジニアは、公開されたモデル重みとコードでAuK-Flashの品質、推論コスト、対象タスクへの適合性を次スプリントで検証するとよい。
推奨:AuK-Flashは4ステップ推論で高速化する蒸留モデルである。