注目★★★★★Hugging Face Papers
ロボット基盤モデル、LITで未知視点の成功率を13.30〜16.70ポイント改善
30秒で把握
- 1LITがロボット基盤モデルの視覚依存による汎化低下を抑制
- 24構成でLIBERO-Plus成功率を3.87〜10.70ポイント改善
- 3未知カメラ・照明・妨害物の実環境で13.30〜16.70ポイント向上
要約
ロボット基盤モデルの視覚分布シフトによる性能低下に対し、Latent Interface Training(LIT)が視覚情報の近道利用を抑えて汎化性能を高めた。LITは、画像なしで終端SE(3)エンドエフェクタ姿勢に条件付けた行動事前分布を学習し、次に姿勢再構成で監督した潜在インターフェースだけを視覚条件付け経路にする2段階方式だ。Pi0.5、MolmoAct2、FAST-WAM、ImageWAMの4構成で、LIBERO-Plusの成功率を3.87〜10.70ポイント改善し、平均LIBERO性能も維持または向上した。実環境では未知のカメラ配置、照明変化、妨害物を含む3タスクで成功率が13.30〜16.70ポイント上がった。
あなたへの影響
ロボット基盤モデルを開発・評価するチームは、視覚条件付け経路と未知カメラ・照明・妨害物への性能をLITの構成で検証する価値がある。
推奨:視覚分布シフトで既存モデルの行動性能が低下する可能性があるため、LIBERO-Plusなどの変動条件を評価項目に加えるべきだ。