注目★★★★★Hugging Face Papers
DeepSeek-V4 を Ascend NPU で高速学習、最適化フレームワーク SLAI T-Rex を開発
30秒で把握
- 1Ascend NPU SuperPOD で DeepSeek-V4 全パラメータ学習を 2.93 倍高速化・MFU 34.22% を実現
- 2モデル並列化・計算通信協調・カーネル最適化の 3 層フレームワーク SLAI T-Rex を開発・学習安定性を維持
- 3OR タスク向け CPT/SFT パイプラインで 10K サンプル整備・zero-shot Pass@1 71.81% を達成
要約
華為技術と関連機関は、Ascend NPU SuperPOD 上で DeepSeek-V4 ファミリーの全パラメータ学習を最適化する SLAI T-Rex フレームワークを開発した。モデル並列化・計算通信協調・カーネル実行の 3 層最適化により、オープンソース基準比 2.93 倍の効率改善を達成し、Model FLOPs Utilization (MFU) 34.22% を実現した。さらに Operations Research (OR) タスク向けの継続学習 (CPT) と監督学習 (SFT) パイプラインを構築し、4 タスク・3 問題形式にわたる 10K サンプルのデータセットを整備した。開発モデルは OR タスクで 71.81% の zero-shot Pass@1 スコアを達成し、GPT-5.4-Mini や DeepSeek-V4-Flash ベースモデルを上回った。
あなたへの影響
GPU クラスタ主流の LLM 学習の中で、NPU (昇騰) 環境での兆規模 MoE 最適化例として参考になる。
推奨:メモリ圧力・通信オーバーヘッド・カーネル効率といった実装レベルの課題解決方法と、2.93 倍の改善値は大規模モデル開発チームが自社インフラの性能評価時に確認する価値がある。