Asayomu Tech
注目★★★★★Hacker News

Qwen3.8 27B、4-bitは品質維持も1-bitで性能崩壊

30秒で把握

  • 1Qwen3.8 27Bの17GB Q4_K_MがBF16版とTerminal-Bench 2.1で同等
  • 255GBのBF16版に対しQ4_K_Mは24GB GPUと約64kトークンに対応
  • 31-bit量子化はGPQA Diamondでランダム水準まで性能が崩壊

要約

Qwen3.8 27Bは、17GBの4-bit量子化版Q4_K_MがBF16版とTerminal-Bench 2.1で同等の結果を出した。55GBのBF16版に対し、Q4_K_Mは24GBのRTX 4090に収まり、約64kトークンのコンテキスト余地も残る。GPQA Diamondでは4-bitまで差が小さく、IFBenchでは2-bitまでモデル間の差がなかった。一方、1-bit量子化はGPQA Diamondでほぼランダム推測となり、推論時間を延ばすほど空回答が増えて悪化した。実験では、量子化より推論強度の設定がスコアを大きく左右し、GPQA Diamondのxhigh設定には約8k推論トークンが必要だった。

あなたへの影響

Qwen3.8 27Bをローカル運用する日本のエンジニアは、まずGPU容量とKV-cacheを合わせてQ4_K_Mを次スプリントで検証し、品質要件をベンチマークで確認すべきです。

推奨:量子化でモデル本体を縮めてもKV-cacheにはF16で32kトークン当たり約2.3GB必要なため、コンテキスト長を含めて容量を見積もってください。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。