Asayomu Tech
注目★★★★Hugging Face Papers

14Bパラメータで実現、リアルタイム人物アニメーション「LiveAnimate」が3分超の長時間生成に対応

30秒で把握

  • 1LiveAnimate が 14B 動画 DiT で 3 分超のポーズ駆動アニメーションを 19.63 FPS リアルタイム生成
  • 2Reference-Anchored Adapter と Pose-Retrieval Sink Attention により、ストリーム長に関わらずメモリ・レイテンシを定値に維持
  • 3ライブ配信・テレプレゼンス・AI アバター用途での実運用化が技術的に可能になり、関連プロダクト開発チームの要評価対象

要約

Meta と UC Berkeley の研究チームが LiveAnimate を発表した。姿勢駆動型アニメーション生成を 14B パラメータの動画 Diffusion Transformer (DiT) で実装し、参照画像と姿勢ストリームから対象人物のリアルタイムビデオ合成を実現した。Reference-Anchored Teacher-Forcing Adaptation と Block-wise Self-Forcing Distillation の 2 段階学習により、サンプリング予算を 3 ステップまで削減した。Pose-Retrieval Sink Attention (PR-Sink) により、姿勢の再出現時に過去のブロックから自動的に外観を復元し、ストリーム長に関わらず定メモリ・定レイテンシを実現した。NVIDIA H100 GPU 2 基での 19.63 FPS ストリーミング推論に対応し、3 分超のベンチマーク生成で安定性を実測した。

あなたへの影響

従来の拡散型アニメーション手法は数分〜数時間の生成時間が必要だったため、インタラクティブアプリケーションには実用的でなかった。

推奨:本手法は分散メモリ構造と段階的蒸留により、3 分超の連続ストリーム生成をリアルタイムで実現するため、ライブ配信やテレプレゼンス、AI アバター実装を検討するチームは論文の PR-Sink メカニズムと蒸留戦略を評価対象に加える価値がある。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。