Asayomu Tech
注目★★★★Hugging Face Papers

拡散言語モデルの MoE スケーリング則、30B-A3B の LLaDA MoE v2 で実証

30秒で把握

  • 1拡散言語モデル MoE のスケーリング則を初体系化・バッチサイズ成長・学習率減衰の定量差を実測
  • 2IsoFLOP 分析で データ側がやや優位・大規模ほど専門家プール数増加・中程度粒度が最効率と判明
  • 3LLaDA MoE v2 (30B-A3B) を Qwen3 の 65% トークンで訓練・推論コーディング 8 項目中 7 項目で従来モデルを超過

要約

拡散言語モデル (dLLM) における Mixture-of-Experts (MoE) のスケーリング挙動を初めて体系的に特性化した研究。最適バッチサイズは計算量に対してより急速に成長し、学習率は急速に減衰すること、データ側が計算側よりもやや優位であること、大規模ほど専門家プール数が増加し中程度の粒度が効果的であることを明らかにした。これらの知見に基づき、23.5T トークンで 30B-A3B の LLaDA MoE v2 を訓練し、Qwen3 の 65% のトークンで複数の知識・推論・コーディングベンチマークで同等の性能を達成した。教師あり微調整後は 8 つの推論・コーディングベンチマーク中 7 つで SDAR Chat を上回った。

あなたへの影響

この記事が日本のエンジニアに与える影響と、今日取るべきアクションは、Personal会員向けに掲載しています。

7日間無料で読む

クレカ不要・いつでも解約

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。