注目★★★★★Hugging Face Papers
エージェント型 RL の信用割当を解く、再帰的自己蒸留 AgentOPSD
30秒で把握
- 1AgentOPSD がトークンレベル蒸留をターンレベルに集約、再帰的ベイズ更新で信用割当を解く
- 2ALFWorld 89.1% 成功率・GRPO 超過・批評者ネットワーク不要で計算効率も向上
- 3Web インタラクション・多ターン推論が必要な実務エージェントの精度向上に応用可能
要約
AgentOPSD は長期多ターンのエージェント強化学習で、重要な決定にクレジットを正確に割り当てる新手法を提案した。トークンレベルの教師-生徒対数確率ギャップをターンレベルで集約し、ベイズ信念状態を対数オッズ空間で再帰的に更新して、スパースな結果報酬を密なターンレベル信用信号に変換する。Qwen2.5-7B で ALFWorld 89.1% 成功率を実現し、GRPO や自己蒸留ベースラインを上回った。批評者ネットワークや追加ロールアウトを不要とし、標準的なポリシー最適化と完全互換である。
あなたへの影響
ALFWorld・WebShop・Search-QA など複合的なタスクでのクレジット割当改善は、多段階の推論が必要な実務的なエージェント応用(自動化ツール・検索・意思決定システム)の精度向上に直結するため、大規模モデルのファインチューニング・強化学習の実装を検討中のチームは論文の手法を評価に組み込む価値がある。
推奨:現時点で即時対応は不要です。必要に応じて原文を確認してください。