Asayomu Tech
注目★★★★★Hugging Face Papers

DomainShuttle:被写体の特徴を保持しながら動画生成の自由度を両立

30秒で把握

  • 1DomainShuttle が同一ドメイン・異ドメイン両シナリオで被写体忠実度と編集性を両立する S2V 生成手法を提案
  • 2Domain-MoT と Video-Reference DualRoPE により被写体特徴の精密な分離・モデリングを実現
  • 3Cross-Pair Consistent Loss で関連性のない特徴を除外し、テキスト指示への反応性を向上

要約

オープンドメイン被写体駆動テキスト・トゥ・ビデオ (S2V) 生成において、既存手法は同一ドメイン内での被写体忠実度を重視するあまり、異なるドメインやスタイルでの編集性が制限されていた。DomainShuttle は被写体の本質的な特徴を保持しながら、テキストプロンプトに応じてドメイン間を柔軟に移行する新手法を提案する。Domain-MoT により動画と参照画像の特徴を分離し、Video-Reference DualRoPE で被写体レベルの空間モデリングを精密化、Cross-Pair Consistent Loss で関連性のない特徴の影響を除外する。これにより同一ドメイン・異ドメイン両シナリオで高い忠実度と生成の自由度を実現した。

あなたへの影響

テキスト・トゥ・ビデオ生成を本番運用する場合。

推奨:被写体の一貫性を保ちながら多様なシーンやスタイルでの適用が重要になってくるため、この手法の域外適応性は実装評価の際に確認する価値がある。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。