Asayomu Tech
注目★★★★★Hugging Face Papers

Gated DeltaNet、NVFP4 4-bit化でも長文性能を維持

30秒で把握

  • 1Minima が Qwen3.8-27B 全496線形層を NVFP4 W4A4 化
  • 2BF16 と同等性能・重み17.5 GiB・prefill 14〜19%高速化
  • 3GDNの再帰ノイズは蓄積せず数百ステップ以内に減衰

要約

Minima は Qwen3.8-27B の全496線形層を NVFP4 W4A4 で量子化し、Gated DeltaNet(GDN)を含めて BF16 と同等の性能を維持した。4K・32K perplexity、MMLU-Pro、GSM8K、AIME'25、GPQA-Diamond、LiveCodeBench、64KまでのRULER検索で、5タスク平均差は-0.52だった。重みは17.5 GiBで、従来の部分量子化よりprefillが14〜19%速く、BF16比で約2.9倍小さい。NVFP4の16要素ブロックスケーリングが外れ値を局所化し、GDNのゲートは約11%のGEMM誤差を約2%の出力誤差に抑えた。デルタ則の再帰状態もノイズを蓄積せず、注入誤差を数百ステップ以内に忘れる。融合GEMMのスケール不整合には補正が必要で、公開チェックポイントは事前補正済みである。

あなたへの影響

GDNを含むハイブリッドLLMの量子化を検討するチームは、公開チェックポイントを同一サービング条件で評価し、融合GEMMのスケール補正を確認すべきです。

推奨:NVFP4 W4A4は重み容量とprefill性能を改善できる可能性があるため、長文推論とKV-cache運用を含めて検証してください。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。