注目★★★★★Hacker News
DeepSeek V4 Flash を AMD MI300X 1 枚で本番運用—メモリ最適化と修正パッチ一式
30秒で把握
- 1DeepSeek V4 Flash (304B) を AMD MI300X 単一枚で本番運用するパッチ・チューニング設定を公開・FP8 互換性と MoE ルーティング修正を含む
- 2MI300X は 192GB HBM、2~8 並行リクエスト、H100 比約半額で導入可能・NVIDIA GPU 依存の軽減
- 3プリフィル性能 6,988~7,019 トークン/秒、AITER GEMM チューニング表と融合 SiLU 最適化により実現・環境別調整が必要
要約
開発者が DeepSeek V4 Flash (304B パラメータ) を単一の AMD MI300X で本番運用するための設定・パッチ・チューニング表をまとめたリポジトリを公開した。MI300X の 192GB HBM と 5.3TB/s メモリ帯域幅により、モデル全体が GPU メモリに収まり、20GB の GPU KV キャッシュと 96GB の CPU オフロード層を備えて 2~8 の並行リクエストを処理できる。vLLM の公式レシピは NVIDIA とより新しい AMD GPU (MI325X/MI355X) を想定しているため、MI300X での単一 GPU 本番構成には FP8 フォーマット、MoE ルーティング、投機的デコーディング、CPU-KV 同期に関する複数の修正が必要だった。プリフェッチなしでのプリフィル性能は 6,988~7,019 トークン/秒 (スケジューラ予算 2,048 トークン条件) を達成し、パッチされた AITER GEMM カーネルと融合 SiLU 最適化により実現されている。
あなたへの影響
この記事が日本のエンジニアに与える影響と、今日取るべきアクションは、Personal会員向けに掲載しています。
クレカ不要・いつでも解約