注目★★★★★Hugging Face Papers
Motif 3:3,140 億パラメータの MoE モデル、GDLA アーキテクチャで推論効率化
30秒で把握
- 1Motif 3 は 314B パラメータの MoE モデル、トークンあたり 13.2B パラメータのみ活性化
- 2GDLA アーキテクチャと MXFP8 計算により、256K 文脈長での推論効率を実現
- 312.5 兆トークンの事前学習と 6 種類の specialist teachers による蒸留で推論・数学・コード能力を統合
要約
Hugging Face は Motif 3 を発表した。314 billion パラメータの decoder-only MoE 言語モデルで、トークンあたり 13.2 billion パラメータのみ活性化する。384 個の routed experts を備え、トークンごとに 8 個を選択する fine-grained sparsity により、高い expert capacity と計算効率を両立させた。Grouped Differential Latent Attention (GDLA) を採用し、grouped differential attention と Multi-head Latent Attention の key-value 圧縮を統合した。manifold-constrained hyper-connections、Expert Specific PolyNorm activations、multi-token prediction により最適化安定性と expert 専門化を強化した。
あなたへの影響
314B パラメータでも活性化パラメータが 13.2B に限定されるため、API 提供やオンプレミス運用時の計算コスト削減につながり得る。
推奨:自社システムへの統合や fine-tuning 検証を検討する際は、GDLA や MXFP8 計算への実装対応と、256K 文脈長の実運用での効果を確認することが重要。