Asayomu Tech
注目★★★★★Hugging Face Papers

ZPPO:教師をプロンプトに組み込む小型モデル向け強化学習手法

30秒で把握

  • 1ZPPOが教師応答をプロンプトに組み込む新RL手法を提案・難問対策
  • 2BCQ・NCQの2種プロンプトとリプレイバッファで汎化性能を向上
  • 3Qwen3.5の0.8B〜9B規模で検証・知識蒸留と通常RLを上回る結果

要約

Zone of Proximal Policy Optimization (ZPPO) は、知識蒸留と強化学習の弱点を補う新しい学習手法を提案した。知識蒸留はロジット模倣により汎化性能が損なわれ、強化学習はロールアウトが全滅した難問でポリシー勾配が崩壊する課題があった。ZPPOは教師をポリシー勾配ではなくプロンプト内に組み込み、難問に対して正解を含む BCQ と誤答を集約した NCQ の2種類のプロンプトを生成する。プロンプトリプレイバッファで学習精度が閾値を超えるまで各難問を再循環させる。

あなたへの影響

小型LLM(0.8B〜9B)のRL学習で難問対応力を高めたい研究者・MLエンジニアは、BCQ/NCQのプロンプト構築とリプレイバッファの組み合わせを自社データで試す価値がある。

推奨:知識蒸留からの置き換え候補として評価パイプラインに組み込むことで、ベンチマーク外の汎化性能が改善する可能性がある。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。