Asayomu Tech
注目★★★★Hugging Face Papers

SFT は競合、RL は共存――LLM マルチタスク学習の理論・実験解析

30秒で把握

  • 1SFT は多タスク学習で深刻な競合・RL は安定共存を実現・パラメータ更新が疎で直交近い構造に
  • 2勾配干渉がノルム限定 (SFT) vs 分散限定 (RL) で質的に異なる・RL の小分散界が直交化を駆動
  • 3Parallel-RL で多タスク訓練を分解・効率と柔軟性を大幅改善・マルチタスク設計の新指針

要約

SFT と RL は LLM のマルチタスク推論で根本的に異なる振る舞いを示す。SFT は多段階学習時に深刻なタスク競合に陥るが、RL は多様なタスク間での安定共存を実現する。RL がタスク間で疎で直交に近いパラメータ更新を誘起する理由を、勾配干渉の理論分析で説明した。SFT の干渉はノルムに限定され勾配の絶対値に応じるのに対し、RL の干渉は分散に限定され、advantage 正規化とオンポリシー最適化の勾配分散に制約される。

あなたへの影響

複数タスク対応 LLM を開発するチームは、SFT でのタスク競合を回避するため、RL ベース学習やフェーズ分離の導入を検討する価値がある。

推奨:Parallel-RL の実装を評価する際は、各タスクの勾配方向の直交性と学習安定性を監視指標に加えることが推奨される。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。