注目★★★★★Hugging Face Papers
MoE モデルの学習率を小規模モデルから推定、兆トークン規模まで外挿可能に
30秒で把握
- 1MoE 向け μP と Muon オプティマイザで最適学習率転送を実証 (R²=0.95)
- 2小規模モデルの学習則から兆トークン規模まで線形回帰で外挿可能
- 3155B 基盤モデル学習で適用・大規模ハイパラスイープを不要化し計算コスト削減
要約
研究者らは Mixture-of-Experts (MoE) モデルの最適学習率を小規模プロキシモデルから大規模モデルへ効率的に転送する手法を提案した。Maximal Update Parameterization (μP) をMoE向けに適用し、モデル幅の異なる複数スケールで最適学習率が一貫して転送可能なことを実証した。さらにスケーリング則を確立して、トークン予算の次元でも転送可能性を拡張し、小規模モデル上の線形回帰から兆トークン規模 (10T トークン) の理想的学習率を R²=0.95 の高精度で外挿できると示した。155B パラメータの基盤モデル学習に適用して、従来の大規模ハイパーパラメータスイープを大幅に削減し、計算効率を飛躍的に向上させた。
あなたへの影響
LLM や基盤モデル開発チームは兆トークン規模の学習前に小規模プロキシモデルでの事前検証ループを導入すれば、ハイパーパラメータスイープに費やす GPU 時間を数分の一に圧縮できるため、今後の大規模学習プロジェクトの予算計画・スケジュール立案を見直す価値がある。
推奨:今週中にチームで影響と対応方針を確認してください。