Asayomu Tech
注目★★★★★Hugging Face Papers

Agent-G²、Gaussian guidanceで長期タスクのRLを効率化

30秒で把握

  • 1Agent-G²がGaussian分布でタスクごとのヒント深度をサンプリング
  • 2ALFWorldで主要3系統を2.3/3.9/7.4ポイント上回る
  • 3追加probeなしでper-sample probingの3分の1未満のrolloutコスト

要約

Agent-G²は、長期のagentic taskでヒントの深さをGaussian分布からタスクごとにサンプリングする強化学習手法だ。方策最適化ですでに収集したrolloutから分布の中心と広がりをオンライン推定し、追加のprobe rolloutや深さ予測器を使わない。ALFWorldとWebShopでQwen2.5-1.5B/7B-Instructを評価し、ALFWorldでは既存の最強hint-based、hint-free、Aux-RLベースラインをそれぞれ2.3、3.9、7.4ポイント上回った。per-sample probingの3分の1未満のrolloutコストで達成した。

あなたへの影響

長期タスクのRLを扱う日本の開発者は、Agent-G²をALFWorldやWebShop相当の環境で既存rolloutだけを使う設定として次の評価候補に加えるとよい。

推奨:ヒントの深さを固定値で扱うより、タスク難度のクラスタと分散を考慮した探索設計につながり得る。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。