注目★★★★★Hugging Face Papers
Agent-G²、Gaussian guidanceで長期タスクのRLを効率化
30秒で把握
- 1Agent-G²がGaussian分布でタスクごとのヒント深度をサンプリング
- 2ALFWorldで主要3系統を2.3/3.9/7.4ポイント上回る
- 3追加probeなしでper-sample probingの3分の1未満のrolloutコスト
要約
Agent-G²は、長期のagentic taskでヒントの深さをGaussian分布からタスクごとにサンプリングする強化学習手法だ。方策最適化ですでに収集したrolloutから分布の中心と広がりをオンライン推定し、追加のprobe rolloutや深さ予測器を使わない。ALFWorldとWebShopでQwen2.5-1.5B/7B-Instructを評価し、ALFWorldでは既存の最強hint-based、hint-free、Aux-RLベースラインをそれぞれ2.3、3.9、7.4ポイント上回った。per-sample probingの3分の1未満のrolloutコストで達成した。
あなたへの影響
長期タスクのRLを扱う日本の開発者は、Agent-G²をALFWorldやWebShop相当の環境で既存rolloutだけを使う設定として次の評価候補に加えるとよい。
推奨:ヒントの深さを固定値で扱うより、タスク難度のクラスタと分散を考慮した探索設計につながり得る。