Asayomu Tech
注目★★★★Hugging Face Papers

JoyAI-Echo-1.5、長編映像と操作可能な世界を一体生成

30秒で把握

  • 1JoyAI-Echo-1.5 が長編動画と操作可能な世界を統合生成
  • 2WBench 平均81.7点でワールドモデル版が1位を獲得
  • 3クロスショット記憶と6-DoF制御で外見・音声・視点を継続

要約

JoyAI-Echo-1.5は、長編動画とインタラクティブな世界を生成する音声・映像統合システムとして公開された。長編動画版は複数ショットの視覚情報と音声から抽出した話者情報を記憶し、登場人物の外見と声を継続させる。ワールドモデル版は異種ナビゲーション入力を計測対応の6-DoFカメラ軌道へ変換し、視点変更を伴う操作に対応する。自己生成ロールアウトを用いた学習により、長時間生成の安定性を高めた。ワールドモデル版はWBenchで平均81.7点を獲得し1位となり、長編動画版もショット間一貫性、映像品質、テキスト整合性、音声忠実度で既存ベースラインを上回った。

あなたへの影響

長編動画やシミュレーション環境を開発するチームは、キャラクター継続性とカメラ制御の評価対象としてJoyAI-Echo-1.5を検証するとよい。

推奨:記憶・幾何制御・ロールアウト学習を組み合わせる設計は、長時間生成の破綻低減につながり得るため、既存パイプラインとの比較試験を実施したい。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。