Asayomu Tech
注目★★★★★Hugging Face Papers

Geometric Action Model:3D幾何学基盤でロボット操作精度向上

30秒で把握

  • 1GAMがGFMを中間分割し知覚・予測・行動を単一バックボーンで統合
  • 2言語条件付き因果予測器で将来潜在トークンを生成し3D幾何学を活用
  • 3実ロボット含む複数ベンチマークで既存基盤モデルより精度・速度・軽量性で上回る

要約

研究チームはGAM(Geometric Action Model)を提案し、事前学習済みの幾何学基盤モデル(GFM)をロボット操作ポリシーの知覚・時系列予測・行動デコードに直接活用した。既存のVLAやWAMが2D画像空間で動作するのに対し、GAMはGFMを中間層で分割し、浅層を観測エンコーダ、挿入した因果予測器で言語・固有感覚・行動履歴から将来の潜在トークンを予測する。シミュレーションおよび実ロボットの操作ベンチマーク群で、GAMは現行の基盤モデル規模のベースラインより精度・ロバスト性・速度・軽量性すべてで優れた結果を出した。

あなたへの影響

接触の多い物体操作タスクに取り組むロボティクスエンジニアは、既存の2D中心なVLAの代替としてGAMアーキテクチャの評価を検討する価値がある。

推奨:アーキテクチャ改変が最小限で済むため、既存GFMへの組み込みコストが低い可能性がある。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。