Asayomu Tech
注目★★★★★Hugging Face Papers

ロボット操作の動画予測モデル DreamX-Phi 1.0、WorldArena で上位入賞

30秒で把握

  • 1DreamX-Phi 1.0 が観測フレーム・言語指示・動作列から将来映像を予測するロボット用世界モデル
  • 2SE(3) 変換・深度ブランチ・SAM3 マスク + V-JEPA で腕同一性と物体一貫性を確保
  • 3WorldArena 2.0 で Track 1 優勝・Track 2 準優勝・モデルとコードが公開予定

要約

DreamX-Phi 1.0 は、現在のフレーム・言語指示・ロボット腕の動作列(エンドエフェクタ位置とグリッパ状態)から将来の映像を予測する動画世界モデルである。単なるリアリズムでなく忠実性を確保するため、SE(3) 幾何変換を注意機構に注入して各腕の命令経路を保持し、腕の同一性と剛体運動の構造を維持した。深度ブランチとSAM3マスク+凍結V-JEPA教師で、物体把持時の一貫性も確保した。多段階生成器を分布マッチング蒸留で少段階学生へ圧縮し、効率的デプロイを実現した。

あなたへの影響

ロボット制御システムに動画予測を組み込むチームは、このモデルの構造(特に SE(3) 幾何変換と深度・物体追跡機構)を参考に自社システムの精度向上を評価する価値がある。

推奨:現時点で即時対応は不要です。必要に応じて原文を確認してください。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。