注目★★★★★Hugging Face Papers
動画生成モデルの蒸留、「多様性」と「品質」を両立させる新手法
30秒で把握
- 1動画蒸留で初期化段階とDMD段階の目標分布のズレを指摘、モードカバレッジ重視の新評価プロトコル導入
- 2ジョイント蒸留により品質・網羅性・多様性すべて向上、1.3Bで14B従来法超過
- 3軽量化モデルの実用化に向け、多様性維持と品質保証の両立が達成可能
要約
動画生成の知識蒸留で、従来は初期化と分布マッチング段階を分離していたが、異なる目標分布を追求するため最適でないと指摘。本論文は分布的観点から再検討し、初期化は高品質だけでなく「モードカバレッジ(多様性)」も重視すべきと論じた。新しい評価プロトコルで潜在空間での精度と網羅性を測定し、VBench等の視覚スコアでは隠れた問題を発見。さらにDMD(Distribution Matching Distillation)の逆KL目的が学習後期で確率の高い領域に集中させ多様性を損なう問題に対し、モード追求とモードカバレッジの制約を組み合わせた「ジョイント蒸留」を提案。実験結果は品質、カバレッジ、多様性すべてで改善し、1.3Bパラメータの小規模教師モデルでも14Bの従来手法を上回った。
あなたへの影響
動画生成モデルを軽量化する際、単に教師モデルの出力を模倣するだけでなく、生成される動画の多様性を保つことが重要な課題。
推奨:本手法は小規模な学生モデルでも実用的な品質を維持できる可能性を示唆し、エッジデバイスや推論コスト削減を重視するチームの実装参考になる。