注目★★★★★Hugging Face Papers
Flow-DPPO:フローモデル向け発散近傍制約でRL学習を改善
30秒で把握
- 1Flow-DPPOがPPO比率クリッピングをKL発散制約に置換し報酬向上を達成
- 2フローモデルのガウス方策を活用しKL計算を厳密・低コストで実現
- 3破滅的忘却軽減・マルチエポック安定化・コード公開済み
要約
Tencentらは、フローマッチングモデルの強化学習ファインチューニングにおいて、既存のPPO式比率クリッピングが構造的に不適合であると論じた。フローモデルの方策比率はノイズの多い単一サンプル推定であり、軌道の一部で過剰制約・別の部分で制約不足が生じる問題を持つ。提案手法Flow-DPPOは比率クリッピングを発散近傍制約(KLダイバージェンス)に置き換え、ステップ単位の方策がガウス分布であることを利用してKLを厳密かつ低コストで計算する。
あなたへの影響
画像・動画生成モデルのRLファインチューニングを検討しているチームにとって参考になる手法だが、即時の実用切替は不要。
推奨:興味があれば公開コードで既存パイプラインとの比較検証を行う程度で良い。