注目★★★★★Hugging Face Papers
TrOPD:信頼領域を活用したオンポリシー蒸留手法を提案
要約
LLMの効率的なポストトレーニング手法であるOn-Policy Distillation(OPD)は、教師・生徒間の分布乖離が大きい場合に学習が不安定になる課題を抱える。この問題に対し、信頼領域内でのみ教師監督を行うTrust Region On-Policy Distillation(TrOPD)が提案された。外れ値領域にはグラジエントクリッピングやマスキング等を適用し、オフポリシーガイダンスで探索を補助する。数学的推論・コード生成・汎用ベンチマークでOPD・EOPD・REOPOLDなどの既存手法を上回る性能を示した。
あなたへの影響
LLMの蒸留・圧縮研究に取り組むチームにとって参考になる手法論だが、即時の実装変更を迫るものではない。
推奨:興味のある研究者は論文を確認する程度で良い。