注目★★★★★Hugging Face Papers
H3-World、33B動画生成器を言語で動く世界モデルへ
30秒で把握
- 1H3-World が 33B MiniMax-H3 を対話可能な世界モデルへ変換
- 28,000 サンプルと LoRA 10,000 ステップで 0.199% を学習
- 3時間区間ごとの指示でキャラクターとカメラを制御
要約
H3-Worldは、33BのMiniMax-H3動画生成器を対話可能な世界モデルへ変換するフレームワークだ。キャラクターとカメラの指示を構造化し、動画潜在表現の時間区間に対応付けることで、専用の行動モジュールなしに自然言語から精密な制御を実現した。Temporal attention routingが各指示を指定区間に限定し、行動間の制御漏れを抑える。8,000件のゲームプレイサンプル、LoRA最適化10,000ステップ、学習対象パラメータ0.199%で、生成品質を保ったまま未見の状況にも一般化した。
あなたへの影響
生成動画や世界モデルを扱う日本のエンジニアは、専用アクション層を追加する前に、既存の言語経路を使った制御方式を評価対象に加えるとよい。
推奨:少量データとLoRAで適応できるため、未見シナリオでの時間制御漏れと生成品質を検証する価値がある。