Asayomu Tech
注目★★★★★Hugging Face Papers

H3-World、33B動画生成器を言語で動く世界モデルへ

30秒で把握

  • 1H3-World が 33B MiniMax-H3 を対話可能な世界モデルへ変換
  • 28,000 サンプルと LoRA 10,000 ステップで 0.199% を学習
  • 3時間区間ごとの指示でキャラクターとカメラを制御

要約

H3-Worldは、33BのMiniMax-H3動画生成器を対話可能な世界モデルへ変換するフレームワークだ。キャラクターとカメラの指示を構造化し、動画潜在表現の時間区間に対応付けることで、専用の行動モジュールなしに自然言語から精密な制御を実現した。Temporal attention routingが各指示を指定区間に限定し、行動間の制御漏れを抑える。8,000件のゲームプレイサンプル、LoRA最適化10,000ステップ、学習対象パラメータ0.199%で、生成品質を保ったまま未見の状況にも一般化した。

あなたへの影響

生成動画や世界モデルを扱う日本のエンジニアは、専用アクション層を追加する前に、既存の言語経路を使った制御方式を評価対象に加えるとよい。

推奨:少量データとLoRAで適応できるため、未見シナリオでの時間制御漏れと生成品質を検証する価値がある。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。