Asayomu Tech
注目★★★★Hugging Face Papers

DreamX-Creator 1.0、7Bで音声付き2K動画を一体生成

30秒で把握

  • 1DreamX-Creator 1.0が7Bで音声・映像の同期生成を実現
  • 2Gated Cross-Modal Attentionと強化学習で両モダリティを結合
  • 37B生成器と2K Refinerを公開し高解像度生成に対応

要約

DreamX-Creator 1.0は、7Bの生成器で音声と映像を同期して生成するネイティブ音声・動画生成システムだ。初期フレームとテキストを条件に、音声・映像ストリームを別々に処理した後、Gated Cross-Modal Attentionで結合する。2段階の事前学習と高品質ファインチューニング、マルチモーダルフィードバックを用いる強化学習で生成器を訓練した。1回のdenoising評価で各時間チャンクを処理するAutoregressive 1-Step 2K Refinementにより、高解像度出力を実現する。7B生成器と2K Refinerを公開し、オープンソースの最先端システムと競合する性能を達成した。

あなたへの影響

音声と映像を一体生成する基盤を評価するチームは、公開された7B生成器と2K Refinerを使った同期精度・推論コストの検証を次スプリントで行うとよい。

推奨:Gated Cross-Modal Attentionは音声・映像間の情報交換を制御する仕組みである。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。