Asayomu Tech
注目★★★★Hugging Face Papers

AlayaWorld:テキストから 24fps の対話型仮想世界を自動生成、長時間一貫性を実現

30秒で把握

  • 1AlayaWorld が 15B 動画拡散トランスフォーマーでテキストから 24fps 対話型仮想世界を生成
  • 2永続的フレーム・幾何学的メモリで長期一貫性確保・推論 30→4 ステップへ高速化
  • 3iWorld-Bench で長時間生成最高性能達成・オープンソースフルスタック設計で実装可能

要約

Hugging Face が AlayaWorld を公開した。テキスト・画像・動画から対話的な仮想環境を即座に生成する 15B パラメータの動画拡散トランスフォーマーモデルで、540p・720p で 24fps の動画を出力する。カメラ軌跡とテキストプロンプトに基づいて潜在空間チャンク自動回帰生成し、永続的フレーム・圧縮時間履歴・幾何学的空間メモリ・直近フレーム条件付けを組み合わせた有界視覚コンテキストで長期ドリフトを制御する。

あなたへの影響

この記事が日本のエンジニアに与える影響と、今日取るべきアクションは、Personal会員向けに掲載しています。

7日間無料で読む

クレカ不要・いつでも解約

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。