注目★★★★★Hugging Face Papers
単眼動画から 4D 人間を復元、マルチビュー一貫性を保つ生成手法
30秒で把握
- 14DAnyone:単眼動画からマルチビュー一貫性を保持しながら 4D Gaussian Splatting へ変換・復元
- 2有界注意コンテキスト問題を Reference Context Packing と Target Context Routing で解決・数十視点規模での一貫性確保
- 3DNA-Rendering と DyMVHumans ベンチマークで先行手法を上回る・ゲーム内データセット MVGameHuman を構築
要約
4DAnyone は単眼動画から 4D 人間を復元するフレームワークで、マルチビュー一貫性を持つ動画を生成した後 4D Gaussian Splatting に変換する。既存の拡散モデルは新規視点の動画合成に成功するが、4DGS 復元に必要な数十視点規模ではビューの一貫性が崩壊する「有界注意コンテキスト問題」に直面していた。4DAnyone は Reference Context Packing で参照ビュー群を固定長混合解像度に圧縮し、Target Context Routing でデノイジング中に目標ビュー群をローテーションさせることで、この問題を解決した。DNA-Rendering と DyMVHumans ベンチマークで従来手法を上回る結果を達成した。
あなたへの影響
大規模マルチビュー生成の一貫性問題を解く技術として、ゲーム開発・VFX・3D キャプチャの実装チームにとって参考となる。
推奨:Reference Context Packing と Target Context Routing の設計パターンは、他のマルチビュー生成タスク (建物・物体復元) にも応用できる可能性がある。