注目★★★★★Hugging Face Papers
Gated DeltaNet、NVFP4 4-bit化でも長文性能を維持
30秒で把握
- 1Minima が Qwen3.8-27B 全496線形層を NVFP4 W4A4 化
- 2BF16 と同等性能・重み17.5 GiB・prefill 14〜19%高速化
- 3GDNの再帰ノイズは蓄積せず数百ステップ以内に減衰
要約
Minima は Qwen3.8-27B の全496線形層を NVFP4 W4A4 で量子化し、Gated DeltaNet(GDN)を含めて BF16 と同等の性能を維持した。4K・32K perplexity、MMLU-Pro、GSM8K、AIME'25、GPQA-Diamond、LiveCodeBench、64KまでのRULER検索で、5タスク平均差は-0.52だった。重みは17.5 GiBで、従来の部分量子化よりprefillが14〜19%速く、BF16比で約2.9倍小さい。NVFP4の16要素ブロックスケーリングが外れ値を局所化し、GDNのゲートは約11%のGEMM誤差を約2%の出力誤差に抑えた。デルタ則の再帰状態もノイズを蓄積せず、注入誤差を数百ステップ以内に忘れる。融合GEMMのスケール不整合には補正が必要で、公開チェックポイントは事前補正済みである。
あなたへの影響
GDNを含むハイブリッドLLMの量子化を検討するチームは、公開チェックポイントを同一サービング条件で評価し、融合GEMMのスケール補正を確認すべきです。
推奨:NVFP4 W4A4は重み容量とprefill性能を改善できる可能性があるため、長文推論とKV-cache運用を含めて検証してください。