Asayomu Tech
注目★★★★★Hugging Face Papers

DeepSeek-V4 を Ascend NPU で高速学習、最適化フレームワーク SLAI T-Rex を開発

30秒で把握

  • 1Ascend NPU SuperPOD で DeepSeek-V4 全パラメータ学習を 2.93 倍高速化・MFU 34.22% を実現
  • 2モデル並列化・計算通信協調・カーネル最適化の 3 層フレームワーク SLAI T-Rex を開発・学習安定性を維持
  • 3OR タスク向け CPT/SFT パイプラインで 10K サンプル整備・zero-shot Pass@1 71.81% を達成

要約

華為技術と関連機関は、Ascend NPU SuperPOD 上で DeepSeek-V4 ファミリーの全パラメータ学習を最適化する SLAI T-Rex フレームワークを開発した。モデル並列化・計算通信協調・カーネル実行の 3 層最適化により、オープンソース基準比 2.93 倍の効率改善を達成し、Model FLOPs Utilization (MFU) 34.22% を実現した。さらに Operations Research (OR) タスク向けの継続学習 (CPT) と監督学習 (SFT) パイプラインを構築し、4 タスク・3 問題形式にわたる 10K サンプルのデータセットを整備した。開発モデルは OR タスクで 71.81% の zero-shot Pass@1 スコアを達成し、GPT-5.4-Mini や DeepSeek-V4-Flash ベースモデルを上回った。

あなたへの影響

GPU クラスタ主流の LLM 学習の中で、NPU (昇騰) 環境での兆規模 MoE 最適化例として参考になる。

推奨:メモリ圧力・通信オーバーヘッド・カーネル効率といった実装レベルの課題解決方法と、2.93 倍の改善値は大規模モデル開発チームが自社インフラの性能評価時に確認する価値がある。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。