注目★★★★★Hugging Face Papers
VLAct、ロボット軌跡20%で未知の身体にも汎化
30秒で把握
- 1VLActが多様なロボットデータでVLA表現を事前学習し性能向上
- 2LIBERO-Plus 82.6%、RoboTwin 2.0 92.5%の成功率を達成
- 3未知の人型ロボットで軌跡20%からGR00T-N1.6全量を上回る
要約
研究チームは、ロボットデータ量の拡大だけでなく表現学習を重視するVLA継続事前学習手法「VLAct」を提案した。多様な身体構成のロボットデータでVLMの視覚・言語知識を保ち、共有アクション意味論と連続アクションの同時学習を促す。LIBERO-Plusで82.6%、RoboTwin 2.0で92.5%の成功率を達成し、ABot-M0やLingBot-VLAを上回った。未知の人型ロボットを扱うRoboCasa-GR1では、下流軌跡20% בלבדで全量データのGR00T-N1.6を上回った。オープンソースデータと16 GPUで学習でき、データ規模とは独立したVLA性能向上軸を示した。
あなたへの影響
VLAを開発する日本の研究チームは、ロボットデータを増やす前にVLActの公開データ・モデル・学習パイプラインを用いた再現評価を次の実験計画に組み込む価値がある。
推奨:異なるロボット身体への転移性能が課題なら、共通表現とタスク固有アクションヘッドの構成を比較検証したい。