注目★★★★★Hugging Face Papers
LynnReal-Omni、32Bで制御可能な動画生成を統合
30秒で把握
- 1LynnReal-Omniが32Bモデルで7種の動画生成・編集機能を統合
- 227B Flashを用いH100で22フレーム540pを377msで処理
- 3画像・3D・ゲーム録画を統合し視覚エージェントを制御
要約
LynnReal-Omniは、エージェント向け視覚制御と高忠実度の動画生成を統合するマルチモーダル基盤を提案した。32Bの共有マルチモーダル拡散Transformerで、Text-to-Video、画像条件生成、参照誘導、構造制御、編集、劣化動画復元、長時間動画生成を統合する。外観参照、編集可能な3Dレンダリング、ゲーム録画を入力し、複数の視覚条件を組み合わせられる。リアルタイム描画向けに27BのFlashモデルも訓練し、H100上で22フレーム・540p動画の生成とデコードを843ms、Flash版を377msで処理した。100プロンプトと20指標で評価するMSAVPも導入した。
あなたへの影響
動画生成や視覚エージェントを開発するチームは、参照画像・3Dシーン・ゲーム状態を使う制御方式と、27B Flashのレイテンシを次の検証対象にできる。
推奨:複数条件を統合するモデルのため、導入時は既存パイプラインとの入力形式と推論コストを確認したい。