注目★★★★★Hugging Face Papers
ZPPO:教師をプロンプトに組み込む小型モデル向け強化学習手法
30秒で把握
- 1ZPPOが教師応答をプロンプトに組み込む新RL手法を提案・難問対策
- 2BCQ・NCQの2種プロンプトとリプレイバッファで汎化性能を向上
- 3Qwen3.5の0.8B〜9B規模で検証・知識蒸留と通常RLを上回る結果
要約
Zone of Proximal Policy Optimization (ZPPO) は、知識蒸留と強化学習の弱点を補う新しい学習手法を提案した。知識蒸留はロジット模倣により汎化性能が損なわれ、強化学習はロールアウトが全滅した難問でポリシー勾配が崩壊する課題があった。ZPPOは教師をポリシー勾配ではなくプロンプト内に組み込み、難問に対して正解を含む BCQ と誤答を集約した NCQ の2種類のプロンプトを生成する。プロンプトリプレイバッファで学習精度が閾値を超えるまで各難問を再循環させる。
あなたへの影響
小型LLM(0.8B〜9B)のRL学習で難問対応力を高めたい研究者・MLエンジニアは、BCQ/NCQのプロンプト構築とリプレイバッファの組み合わせを自社データで試す価値がある。
推奨:知識蒸留からの置き換え候補として評価パイプラインに組み込むことで、ベンチマーク外の汎化性能が改善する可能性がある。