Asayomu Tech
注目★★★★★Hugging Face Papers

ロボットVLAのギリシャ語対応、評価指標の罠を検証

30秒で把握

  • 1ギリシャ語VLA評価で正解84.6%、誤指示82.6%を記録
  • 290タスク・3シードでバイリンガル学習が6.7〜7.1点向上
  • 37種類の言い換えで翻訳表現への過適合を約半減

要約

研究チームは、ロボットVLAポリシーにギリシャ語を追加する際、翻訳より測定設計が難しいと論じた。正しいギリシャ語指示で84.6%、意図的に誤った指示でも82.6%を記録し、単一目標ベンチマークは指示理解を判別できなかった。90タスクを3シードで評価すると、ギリシャ語のみの学習は対照群を最大2.7ポイント上回った一方、英語・ギリシャ語のバイリンガル学習は6.7〜7.1ポイント上回り、英語性能の約5分の2に達した。7種類の言い換えで学習すると、翻訳者の表現への過適合による性能低下が約半分になった。低リソース言語の評価には、まず無効条件を構築し、複数シードで再現する必要がある。

あなたへの影響

多言語ロボットポリシーを評価する日本の研究・開発チームは、単一指標や単一シードで結論を出さず、誤指示を含む無効条件と複数シードの評価を次の実験計画に組み込むべきです。

推奨:無効条件とは、モデルが指示を読まなくても達成できる対照条件を指します。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。