注目★★★★★Hugging Face Papers
N-GRPO:埋め込みレベルの意味的近傍混合でLLM数学推論を改善
30秒で把握
- 1N-GRPO が GRPO に意味的近傍混合を統合し数学推論を改善
- 2DeepSeek-R1-Distill-Qwen 複数サイズで強ベースライン超え・分布外も汎化
- 3トークンサンプリングと埋め込みノイズの二律背反を意味多様体保持で解消
要約
LLMの数学的推論では、ロールアウト時に多様かつ有効な解経路を生成することが重要だが、トークンレベルのサンプリングは表現違いの重複軌跡を生みやすく、埋め込みレベルのランダムノイズは意味的一貫性を損なうという二律背反が課題だった。この問題を解決するため、GRPO フレームワークに統合した新たな探索戦略「N-GRPO」が提案された。N-GRPO はアンカートークンとその意味的最近傍の埋め込みを動的に混合する「Semantic Neighbor Mixing」を採用し、局所的な意味多様体を保ちながら多様性を注入する。DeepSeek-R1-Distill-Qwen モデルの複数サイズで評価した結果、数学推論ベンチマークで強力なベースラインを上回り、分布外タスクにも頑健な汎化性能を示した。
あなたへの影響
GRPO ベースの強化学習で数学推論を改善するアプローチを検討しているチームには参考になる手法。
推奨:現時点では即時対応が必要な実装変更ではなく、DeepSeek-R1-Distill-Qwen を使ったパイプラインを持つ場合に論文を確認する程度でよい。