注目★★★★★Hugging Face Papers
DRACO、長期エージェント訓練を15.9点改善
30秒で把握
- 1DRACOが動的rubricで長期エージェントの報酬をステップ別に再配分
- 2AppWorldでベースモデル比15.9点、疎なground-truth報酬比5.3点向上
- 3Tau-Benchでも5.3点向上、WebArenaでの検証は未実施
要約
IBMは、検証器や正解の成功信号がない長期エージェント訓練向けに、DRACOを提案した。動的に生成した複数基準のrubricを軌跡ごとに採点し、各基準を担ったステップへスコアを再配分して、GRPOで細粒度のadvantageを計算する。再配分は閉形式で、学習済みの帰属モジュールを追加しない。AppWorldでベースモデルを15.9ポイント、疎なground-truth rewardを使うGRPOを5.3ポイント上回った。Tau-Benchでもベースモデルを5.3ポイント上回ったが、WebArenaでは未検証である。
あなたへの影響
長期タスクのRLを扱う日本のエンジニアは、公開コードでAppWorldのrubric生成・ステップ別報酬再配分を再現し、既存のGRPOと比較検証するとよい。
推奨:rubricが方策の得意分野を追認する可能性があるため、基準の変化と未検証環境での性能を継続的に確認する必要がある。