Asayomu Tech
注目★★★★★Hugging Face Blog

NeMo AutoModelでMoEファインチューニングが3.7倍高速化・GPU消費32%減

30秒で把握

  • 1NeMo AutoModelがMoEファインチューニングをTransformers v5比3.4〜3.7倍高速化
  • 2GPU消費29〜32%減・550B〜30Bモデルで検証済み・HFチェックポイント互換維持
  • 3import文1行の変更のみで適用可能・既存コードの書き換え不要

要約

NVIDIAはNeMo AutoModelをTransformers v5上に構築し、MoEモデルのファインチューニングでネイティブTransformers比3.4〜3.7倍のスループット向上と29〜32%のGPUメモリ削減を実現した。実装変更はimport文1行のみで、既存のfrom_pretrained() APIをそのまま利用できる。内部ではExpert Parallelism・DeepEP fused all-to-all dispatch・TransformerEngineカーネルを組み合わせ、通信と演算のオーバーラップを実現している。検証対象はNemotron 3 Ultra 550B A55B(16ノード全パラメータファインチューニング)からQwen3-30B-A3B・Nemotron 3 Nano 30B A3Bの単一ノード構成まで。生成されるチェックポイントは標準HF形式のためvLLMやSGLangからも直接ロード可能だ。

あなたへの影響

MoEモデルを本番ファインチューニングするチームは、import文1行の変更だけで大幅なコスト削減が見込めるため、次の訓練ジョブ前にNeMo AutoModelへの切り替えを試す価値がある。

推奨:現時点で即時対応は不要です。必要に応じて原文を確認してください。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。