注目★★★★★Hugging Face Papers
弱い教師を超えるOPRD、Verifier付き学習を加速
30秒で把握
- 1OPRDが弱い教師の誘導で強い学生モデルの学習を加速
- 2Verifier支持の方策勾配だけを増幅し停留点を維持
- 3連続移行と複数教師蒸留で既存RL・蒸留を上回る
要約
研究チームは、弱いモデルを教師にして強いモデルが教師性能を超えるOn-Policy Reverse Distillation(OPRD)を提案した。OPRDは学生モデルのロールアウト上で教師の方策変化を評価し、Verifierが支持する方策勾配のうち教師の変化方向に沿う成分だけを増幅する。方策最適化の停留点を保ったまま学習を加速するため、弱い教師の性能上限を学生に課さない。連続モデル移行と複数教師蒸留で、既存のRL・蒸留手法より少ない更新回数で高い性能を達成した。強いモデルから弱いモデルへの通常の蒸留でも、モデル容量の順序にかかわらずVerifier駆動の最適化と教師誘導を統合した。
あなたへの影響
LLMの蒸留や世代移行を扱うチームは、既存のRL・蒸留手法とOPRDを同一更新予算で比較検証するとよい。
推奨:弱い教師の誘導が学生の最適化を変えずに加速し得るため、Verifier設計とロールアウト評価が実装上の要点になる可能性がある。