Asayomu Tech
注目★★★★Hugging Face Papers

Motif 3:3,140 億パラメータの MoE モデル、GDLA アーキテクチャで推論効率化

30秒で把握

  • 1Motif 3 は 314B パラメータの MoE モデル、トークンあたり 13.2B パラメータのみ活性化
  • 2GDLA アーキテクチャと MXFP8 計算により、256K 文脈長での推論効率を実現
  • 312.5 兆トークンの事前学習と 6 種類の specialist teachers による蒸留で推論・数学・コード能力を統合

要約

Hugging Face は Motif 3 を発表した。314 billion パラメータの decoder-only MoE 言語モデルで、トークンあたり 13.2 billion パラメータのみ活性化する。384 個の routed experts を備え、トークンごとに 8 個を選択する fine-grained sparsity により、高い expert capacity と計算効率を両立させた。Grouped Differential Latent Attention (GDLA) を採用し、grouped differential attention と Multi-head Latent Attention の key-value 圧縮を統合した。manifold-constrained hyper-connections、Expert Specific PolyNorm activations、multi-token prediction により最適化安定性と expert 専門化を強化した。

あなたへの影響

314B パラメータでも活性化パラメータが 13.2B に限定されるため、API 提供やオンプレミス運用時の計算コスト削減につながり得る。

推奨:自社システムへの統合や fine-tuning 検証を検討する際は、GDLA や MXFP8 計算への実装対応と、256K 文脈長の実運用での効果を確認することが重要。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。