Asayomu Tech
注目★★★★Hacker News

DeepSeek V4 Flash を AMD MI300X 1 枚で本番運用—メモリ最適化と修正パッチ一式

30秒で把握

  • 1DeepSeek V4 Flash (304B) を AMD MI300X 単一枚で本番運用するパッチ・チューニング設定を公開・FP8 互換性と MoE ルーティング修正を含む
  • 2MI300X は 192GB HBM、2~8 並行リクエスト、H100 比約半額で導入可能・NVIDIA GPU 依存の軽減
  • 3プリフィル性能 6,988~7,019 トークン/秒、AITER GEMM チューニング表と融合 SiLU 最適化により実現・環境別調整が必要

要約

開発者が DeepSeek V4 Flash (304B パラメータ) を単一の AMD MI300X で本番運用するための設定・パッチ・チューニング表をまとめたリポジトリを公開した。MI300X の 192GB HBM と 5.3TB/s メモリ帯域幅により、モデル全体が GPU メモリに収まり、20GB の GPU KV キャッシュと 96GB の CPU オフロード層を備えて 2~8 の並行リクエストを処理できる。vLLM の公式レシピは NVIDIA とより新しい AMD GPU (MI325X/MI355X) を想定しているため、MI300X での単一 GPU 本番構成には FP8 フォーマット、MoE ルーティング、投機的デコーディング、CPU-KV 同期に関する複数の修正が必要だった。プリフェッチなしでのプリフィル性能は 6,988~7,019 トークン/秒 (スケジューラ予算 2,048 トークン条件) を達成し、パッチされた AITER GEMM カーネルと融合 SiLU 最適化により実現されている。

あなたへの影響

この記事が日本のエンジニアに与える影響と、今日取るべきアクションは、Personal会員向けに掲載しています。

7日間無料で読む

クレカ不要・いつでも解約

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。