Asayomu Tech
注目★★★★★Hugging Face Papers

Flow-DPPO:フローモデル向け発散近傍制約でRL学習を改善

30秒で把握

  • 1Flow-DPPOがPPO比率クリッピングをKL発散制約に置換し報酬向上を達成
  • 2フローモデルのガウス方策を活用しKL計算を厳密・低コストで実現
  • 3破滅的忘却軽減・マルチエポック安定化・コード公開済み

要約

Tencentらは、フローマッチングモデルの強化学習ファインチューニングにおいて、既存のPPO式比率クリッピングが構造的に不適合であると論じた。フローモデルの方策比率はノイズの多い単一サンプル推定であり、軌道の一部で過剰制約・別の部分で制約不足が生じる問題を持つ。提案手法Flow-DPPOは比率クリッピングを発散近傍制約(KLダイバージェンス)に置き換え、ステップ単位の方策がガウス分布であることを利用してKLを厳密かつ低コストで計算する。

あなたへの影響

画像・動画生成モデルのRLファインチューニングを検討しているチームにとって参考になる手法だが、即時の実用切替は不要。

推奨:興味があれば公開コードで既存パイプラインとの比較検証を行う程度で良い。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。