注目★★★★★Hugging Face Papers
拡散言語モデルの MoE スケーリング則、30B-A3B の LLaDA MoE v2 で実証
30秒で把握
- 1拡散言語モデル MoE のスケーリング則を初体系化・バッチサイズ成長・学習率減衰の定量差を実測
- 2IsoFLOP 分析で データ側がやや優位・大規模ほど専門家プール数増加・中程度粒度が最効率と判明
- 3LLaDA MoE v2 (30B-A3B) を Qwen3 の 65% トークンで訓練・推論コーディング 8 項目中 7 項目で従来モデルを超過
要約
拡散言語モデル (dLLM) における Mixture-of-Experts (MoE) のスケーリング挙動を初めて体系的に特性化した研究。最適バッチサイズは計算量に対してより急速に成長し、学習率は急速に減衰すること、データ側が計算側よりもやや優位であること、大規模ほど専門家プール数が増加し中程度の粒度が効果的であることを明らかにした。これらの知見に基づき、23.5T トークンで 30B-A3B の LLaDA MoE v2 を訓練し、Qwen3 の 65% のトークンで複数の知識・推論・コーディングベンチマークで同等の性能を達成した。教師あり微調整後は 8 つの推論・コーディングベンチマーク中 7 つで SDAR Chat を上回った。
あなたへの影響
この記事が日本のエンジニアに与える影響と、今日取るべきアクションは、Personal会員向けに掲載しています。
クレカ不要・いつでも解約