Asayomu Tech
注目★★★★★Hugging Face Blog

AI2、言語指示で3D動作予測するMolmoMotionを公開

30秒で把握

  • 1AI2がMolmoMotionを公開・言語指示で3D点軌跡を予測し既存手法を上回る
  • 2116万動画データセットと2,700クリップのベンチマークも同時オープン公開
  • 3ロボット計画・動画生成向けにモデル重み・コード・データを完全公開

要約

Allen AI(AI2)は、自然言語指示と動画フレームから3D点群の将来軌跡を予測するモデル「MolmoMotion」を公開した。入力はRGB画像・クエリ点・行動テキストで、数秒後の3D空間上の動きを予測し、既存の動作予測手法を大幅に上回る性能を達成した。あわせて116万動画から収集した3D点軌跡データセット「MolmoMotion-1M」と、2,700クリップの評価ベンチマーク「PointMotionBench」も同時公開した。

あなたへの影響

ロボット制御や物理シミュレーションを手がける日本のエンジニアにとって、言語指示で任意物体の3D軌跡を予測できる点は実装コスト削減につながり得る。

推奨:モデル重みとデータセットが公開されているため、まず自社ユースケースでのゼロショット評価から着手するとよい。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。