Asayomu Tech
注目★★★★★Hugging Face Papers

エージェント型 RL の信用割当を解く、再帰的自己蒸留 AgentOPSD

30秒で把握

  • 1AgentOPSD がトークンレベル蒸留をターンレベルに集約、再帰的ベイズ更新で信用割当を解く
  • 2ALFWorld 89.1% 成功率・GRPO 超過・批評者ネットワーク不要で計算効率も向上
  • 3Web インタラクション・多ターン推論が必要な実務エージェントの精度向上に応用可能

要約

AgentOPSD は長期多ターンのエージェント強化学習で、重要な決定にクレジットを正確に割り当てる新手法を提案した。トークンレベルの教師-生徒対数確率ギャップをターンレベルで集約し、ベイズ信念状態を対数オッズ空間で再帰的に更新して、スパースな結果報酬を密なターンレベル信用信号に変換する。Qwen2.5-7B で ALFWorld 89.1% 成功率を実現し、GRPO や自己蒸留ベースラインを上回った。批評者ネットワークや追加ロールアウトを不要とし、標準的なポリシー最適化と完全互換である。

あなたへの影響

ALFWorld・WebShop・Search-QA など複合的なタスクでのクレジット割当改善は、多段階の推論が必要な実務的なエージェント応用(自動化ツール・検索・意思決定システム)の精度向上に直結するため、大規模モデルのファインチューニング・強化学習の実装を検討中のチームは論文の手法を評価に組み込む価値がある。

推奨:現時点で即時対応は不要です。必要に応じて原文を確認してください。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。