Asayomu Tech
注目★★★★★Hugging Face Papers

LLM強化学習のトークン信頼領域を累積プレフィックスで改善するCPPO提案

30秒で把握

  • 1CPPOが均一閾値PPOの自己回帰非対称性の欠陥を解消
  • 2位置重み付き閾値+累積プレフィックス予算の2機構で更新制御
  • 3複数モデルスケールで学習安定性と推論精度を改善

要約

既存のPPOベースのLLM強化学習は、全トークンに均一な信頼領域閾値を適用するため、自己回帰生成の非対称性を無視していた。早期トークンのずれは後続シーケンス全体に累積的な影響を与えるが、既存手法はその差を考慮せず、探索の制約が不適切になる問題があった。本研究ではCPPO(累積プレフィックス発散ポリシー最適化)を提案し、位置重み付き閾値と累積プレフィックス予算の2機構を組み合わせることで更新を制御する。実験では複数のモデルスケールにわたり、学習安定性の向上と推論精度の有意な改善を達成した。

あなたへの影響

LLM推論タスクの強化学習パイプラインを構築・評価しているチームには参考になる研究で、PPOの信頼領域設計の改善点として把握しておく程度で良い。

推奨:即時の実装切替が必要な段階ではなく、次回の学習設計見直し時に実装を検討するのが適切。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。