注目★★★★★Hugging Face Papers
Lip Forcing:リアルタイム口パク同期を実現する自己回帰拡散モデル
30秒で把握
- 1Lip Forcingが14B拡散モデルを蒸留し、2ステップでリアルタイム口パク同期を実現
- 21.3Bモデルが31FPS・17.6倍速、14Bモデルが教師比39.8倍速を達成
- 3Time-to-First-Frameがサブミリ秒で全拡散ベースラインを下回る
要約
Lip Forcingは、動画から動画への口パク同期をリアルタイムで実現する初の自己回帰拡散手法として発表された。14Bパラメータの双方向動画拡散モデルを教師として因果的な学生モデルへ蒸留し、推論時はわずか2ステップのノイズ除去でフレームを生成する。1.3Bの学生モデルは31FPSでリアルタイムストリーミングを達成し、同規模の双方向モデル比17.6倍の高速化を実現した。14Bの学生モデルも教師比39.8倍速で動作し、両スケールともTime-to-First-Frameはサブミリ秒を達成している。
あなたへの影響
リアルタイム口パク合成に取り組む映像・音声処理系のチームにとって参考になる研究で、既存の拡散モデルベース手法の速度ボトルネックを蒸留で解消したアプローチは応用範囲が広い。
推奨:即時アクションは不要だが、V2V合成パイプラインを検討しているチームは論文の蒸留手法(Sync-Window DMD・SyncNet報酬)を確認しておくと良い。