注目★★★★★Hacker News
vLLMのSpeculative Decoding、AMD GPUで効果を検証
30秒で把握
- 1vLLMがAMD MI300X・MI355XでSpeculative Decodingを検証
- 2MTP・EAGLE-3・DFlash・DSparkの5方式を比較評価
- 3スループット効果は候補数・モデル・受理率で変動
要約
vLLMはAMD GPU上でSpeculative Decodingを検証し、複数の候補トークンを1回のtarget model推論で確認する仕組みを解説した。native MTP、Gemma 4 MTP、EAGLE-3、DFlash、DSparkの5方式を比較し、候補生成を逐次処理する方式と並列処理する方式の違いを整理した。実験はAMD Instinct MI300XとMI355X、ROCm環境で実施し、output-tokenスループットへの効果は方式、候補数、モデル系列、draft checkpoint、ワークロード、受理率によって変動した。vLLMでは--speculative-configで設定できるが、方式によって対応するdraft checkpointとGPUメモリ余裕が必要になる。
あなたへの影響
AMD GPUでvLLMを運用するチームは、方式とdraft checkpointの互換性、GPUメモリ、候補数を確認し、実ワークロードで受理率とスループットを測定してください。
推奨:Speculative Decodingは候補をdraft modelが生成し、target modelが検証する推論高速化手法です。