注目★★★★★Hugging Face Papers
言語エージェントの強化学習、軌跡から直接抽出する「スキル蒸留」で指導信号を密にする
30秒で把握
- 1OPID が言語エージェント強化学習で軌跡からスキル監督を直接抽出し、トークンレベルの密な指導信号を実現
- 2エピソード・ステップ階層スキルと重要度ルーティングで、外部スキルメモリ不要な分布マッチ監督を提供
- 3RL 目標を主軸に自己蒸留優位を統合し、多ターン相互作用時の方針と状態分布のズレを解消
要約
言語エージェント向けの強化学習は結果ベースの報酬で安定最適化を実現しますが、軌跡レベルの報酬では中間決定の指導に乏しい課題がありました。OPID(On-Policy Skill Distillation)は完了した軌跡から直接スキル監督を抽出する手法を提案します。エピソードレベル(全体的なワークフローや失敗回避ルール)とステップレベル(重要な決定時の局所的知識)の階層的スキルを表現し、重要度ルーティングで使い分けます。選択されたスキルを相互作用履歴に注入し、元のポリシーがスキル増強文脈下でも応答を再採点することで、トークンレベルの自己蒸留優位を生成します。この方法は結果優位と組み合わせてポリシー最適化を行い、RL を主目的としながら分布マッチした密な教示を実現します。
あなたへの影響
言語モデルベースのエージェント開発チームが強化学習を採用する場合、軌跡から自動的に複雑さ別の監督信号を抽出できるため、外部スキルメモリやプリビレッジド情報への依存を削減し学習効率を改善できる可能性があります。
推奨:現時点で即時対応は不要です。必要に応じて原文を確認してください。