Asayomu Tech
注目★★★★★Hugging Face Papers

SANA-Video 2.0、ハイブリッド線形注意で 720p 動画生成を単一 GPU で実現

30秒で把握

  • 1SANA-Video 2.0 が Hybrid Linear-Softmax Attention で 720p 動画生成を H100 単一 GPU で実現、VBench 84.30 達成
  • 2線形注意と周期的ソフトマックスの 3:1 混合により品質を維持しながら O(N) スケーリング、Block Attention Residuals で深層ランク 12% 向上
  • 3480p/40ステップで 13.2 秒、720p/60 秒でソフトマックス比 3.2 倍高速化・動画長が長いほど速度差拡大

要約

Stability AI が SANA-Video 2.0 を発表し、5B・14B スケールのハイブリッド動画拡散トランスフォーマーで 720p 高品質動画生成を単一 H100 で実現した。線形注意と周期的ゲート付きソフトマックスを 3:1 比で組み合わせた Hybrid Linear-Softmax Attention により、フルソフトマックスモデルと同等の品質を保ちながら O(N) スケーリングを維持している。Block Attention Residuals (AttnRes) により深層での表現ランクを 12% 向上させ、480p/40ステップで VBench 84.30 を 13.2 秒で達成した。コンパイル済み DiT は 720p 60 秒で同規模ソフトマックスベースラインの 3.2 倍高速化を実現し、動画長が長いほど速度ギャップが拡大する。

あなたへの影響

動画生成モデルの推論コスト削減が進み、研究機関や小規模チームでも高品質な動画生成が可能になる可能性がある。

推奨:自社サービスに動画生成機能の組み込みを検討する場合、VBench スコアと推論速度のトレードオフを評価し、活用可能な規模を確認する価値がある。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。