注目★★★★★Hugging Face Papers
LLM の強化学習で「タスクごとのエントロピー」を個別制御、GRPO を改良した GEPO
30秒で把握
- 1LLM 強化学習で異質なタスク群の個別エントロピー制御手法 GEPO を提案・13 ベンチマークで GRPO 超過
- 2グループごとに利点形成を非対称に調整・タスク固有の探索レベル保持と汎化性向上を両立
- 3GRPO の軽量拡張・エントロピー統計から適応的閾値導出・複数タスク RLHF チームの検証対象に該当
要約
研究チームは LLM の強化学習において、異なるタスクが異なるエントロピー環境を持つ問題に対し、グループ単位でエントロピーを制御する手法 GEPO を提案した。従来の GRPO はグローバルまたはトークン単位のエントロピー制御しかできず、異質なタスク群での利点信号に統計的バイアスが生じていた。GEPO は既存のグループ化サンプルからグループエントロピーを推定し、低エントロピーグループでは正の利点を減衰させて過度な利用を抑制し、高エントロピーグループでは負の利点を減衰させて探索を保持する非対称な利点形成を行う。13 個のベンチマーク (数学・物理・科学・コード生成・命令従行) で 2 種類の基盤モデルを評価した結果、GEPO は GRPO および最近のエントロピー制御手法を一貫して上回り、タスク固有の探索レベルを維持しながらタスク横断的な改善を実現した。
あなたへの影響
複数タスクを並行学習する LLM ファインチューニング (RLHF/DPO 等) を運用するチームは、タスク依存的なエントロピー特性に対応した GEPO の導入を検討する価値がある。
推奨:コード実装が GRPO の軽量拡張形式のため、既存パイプラインへの統合コストは低い。