Asayomu Tech
注目★★★★★Hugging Face Papers

DRACO、長期エージェント訓練を15.9点改善

30秒で把握

  • 1DRACOが動的rubricで長期エージェントの報酬をステップ別に再配分
  • 2AppWorldでベースモデル比15.9点、疎なground-truth報酬比5.3点向上
  • 3Tau-Benchでも5.3点向上、WebArenaでの検証は未実施

要約

IBMは、検証器や正解の成功信号がない長期エージェント訓練向けに、DRACOを提案した。動的に生成した複数基準のrubricを軌跡ごとに採点し、各基準を担ったステップへスコアを再配分して、GRPOで細粒度のadvantageを計算する。再配分は閉形式で、学習済みの帰属モジュールを追加しない。AppWorldでベースモデルを15.9ポイント、疎なground-truth rewardを使うGRPOを5.3ポイント上回った。Tau-Benchでもベースモデルを5.3ポイント上回ったが、WebArenaでは未検証である。

あなたへの影響

長期タスクのRLを扱う日本のエンジニアは、公開コードでAppWorldのrubric生成・ステップ別報酬再配分を再現し、既存のGRPOと比較検証するとよい。

推奨:rubricが方策の得意分野を追認する可能性があるため、基準の変化と未検証環境での性能を継続的に確認する必要がある。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。