Asayomu Tech
注目★★★★Hugging Face Papers

Show-Harness、VLMを追加学習なしでロボット操作へ

30秒で把握

  • 1Show-Harness が VLM の意図を意味アクション経由でロボット操作へ接続
  • 2クローズドVLMはゼロショット、小規模VLMは数GPU時間で展開
  • 3GUMI が専用テレオペ機器なしのGUIデモ収集を実現

要約

Show-Harnessは、VLMの意図を離散的な意味アクションに変換し、ロボット固有の解釈器で実行動作へ落とし込むインターフェースを提案した。これにより、クローズドソースの先端VLMを追加学習なしでロボット制御に利用でき、小規模なオープンソースVLMも数GPU時間のファインチューニングで低コストに展開できる。GUI Manipulation Interface(GUMI)は同じアクション空間をGUI経由のデモ収集へ拡張し、専用の遠隔操作ハードウェアなしで異なるロボットを操作できる。実験では、タスク・ロボット形態・環境をまたぐ汎化性能で、既存のエージェント方式とVLA方式を上回った。

あなたへの影響

ロボット制御を開発する日本のエンジニアは、VLMの追加学習量だけでなく、意味アクションと機体固有解釈器を分離する構成を次の検証候補にすべきです。

推奨:GUMIはGUIベースのデモ収集を可能にするため、専用テレオペレーション機器を使わないデータ作成の可能性があります。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。