注目★★★★★Hugging Face Papers
SFT は競合、RL は共存――LLM マルチタスク学習の理論・実験解析
30秒で把握
- 1SFT は多タスク学習で深刻な競合・RL は安定共存を実現・パラメータ更新が疎で直交近い構造に
- 2勾配干渉がノルム限定 (SFT) vs 分散限定 (RL) で質的に異なる・RL の小分散界が直交化を駆動
- 3Parallel-RL で多タスク訓練を分解・効率と柔軟性を大幅改善・マルチタスク設計の新指針
要約
SFT と RL は LLM のマルチタスク推論で根本的に異なる振る舞いを示す。SFT は多段階学習時に深刻なタスク競合に陥るが、RL は多様なタスク間での安定共存を実現する。RL がタスク間で疎で直交に近いパラメータ更新を誘起する理由を、勾配干渉の理論分析で説明した。SFT の干渉はノルムに限定され勾配の絶対値に応じるのに対し、RL の干渉は分散に限定され、advantage 正規化とオンポリシー最適化の勾配分散に制約される。
あなたへの影響
複数タスク対応 LLM を開発するチームは、SFT でのタスク競合を回避するため、RL ベース学習やフェーズ分離の導入を検討する価値がある。
推奨:Parallel-RL の実装を評価する際は、各タスクの勾配方向の直交性と学習安定性を監視指標に加えることが推奨される。