Asayomu Tech
注目★★★★Hugging Face Papers

拡散言語モデルの MoE スケーリング則、30B-A3B の LLaDA MoE v2 で実証

30秒で把握

  • 1拡散言語モデル MoE のスケーリング則を初体系化・バッチサイズ成長・学習率減衰の定量差を実測
  • 2IsoFLOP 分析で データ側がやや優位・大規模ほど専門家プール数増加・中程度粒度が最効率と判明
  • 3LLaDA MoE v2 (30B-A3B) を Qwen3 の 65% トークンで訓練・推論コーディング 8 項目中 7 項目で従来モデルを超過

要約

拡散言語モデル (dLLM) における Mixture-of-Experts (MoE) のスケーリング挙動を初めて体系的に特性化した研究。最適バッチサイズは計算量に対してより急速に成長し、学習率は急速に減衰すること、データ側が計算側よりもやや優位であること、大規模ほど専門家プール数が増加し中程度の粒度が効果的であることを明らかにした。これらの知見に基づき、23.5T トークンで 30B-A3B の LLaDA MoE v2 を訓練し、Qwen3 の 65% のトークンで複数の知識・推論・コーディングベンチマークで同等の性能を達成した。教師あり微調整後は 8 つの推論・コーディングベンチマーク中 7 つで SDAR Chat を上回った。

あなたへの影響

自動回帰型ではなく拡散型の言語モデルにおける MoE 最適化の定量的知見は、今後の効率的な大規模言語モデル開発の設計指針として直接参考になる。

推奨:特にトークン効率性が重要な環境では実装検討の価値がある。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。