注目★★★★★Hugging Face Papers
ロボットVLAのギリシャ語対応、評価指標の罠を検証
30秒で把握
- 1ギリシャ語VLA評価で正解84.6%、誤指示82.6%を記録
- 290タスク・3シードでバイリンガル学習が6.7〜7.1点向上
- 37種類の言い換えで翻訳表現への過適合を約半減
要約
研究チームは、ロボットVLAポリシーにギリシャ語を追加する際、翻訳より測定設計が難しいと論じた。正しいギリシャ語指示で84.6%、意図的に誤った指示でも82.6%を記録し、単一目標ベンチマークは指示理解を判別できなかった。90タスクを3シードで評価すると、ギリシャ語のみの学習は対照群を最大2.7ポイント上回った一方、英語・ギリシャ語のバイリンガル学習は6.7〜7.1ポイント上回り、英語性能の約5分の2に達した。7種類の言い換えで学習すると、翻訳者の表現への過適合による性能低下が約半分になった。低リソース言語の評価には、まず無効条件を構築し、複数シードで再現する必要がある。
あなたへの影響
多言語ロボットポリシーを評価する日本の研究・開発チームは、単一指標や単一シードで結論を出さず、誤指示を含む無効条件と複数シードの評価を次の実験計画に組み込むべきです。
推奨:無効条件とは、モデルが指示を読まなくても達成できる対照条件を指します。