注目★★★★★Hacker News
Qwen3.8 27B、4-bitは品質維持も1-bitで性能崩壊
30秒で把握
- 1Qwen3.8 27Bの17GB Q4_K_MがBF16版とTerminal-Bench 2.1で同等
- 255GBのBF16版に対しQ4_K_Mは24GB GPUと約64kトークンに対応
- 31-bit量子化はGPQA Diamondでランダム水準まで性能が崩壊
要約
Qwen3.8 27Bは、17GBの4-bit量子化版Q4_K_MがBF16版とTerminal-Bench 2.1で同等の結果を出した。55GBのBF16版に対し、Q4_K_Mは24GBのRTX 4090に収まり、約64kトークンのコンテキスト余地も残る。GPQA Diamondでは4-bitまで差が小さく、IFBenchでは2-bitまでモデル間の差がなかった。一方、1-bit量子化はGPQA Diamondでほぼランダム推測となり、推論時間を延ばすほど空回答が増えて悪化した。実験では、量子化より推論強度の設定がスコアを大きく左右し、GPQA Diamondのxhigh設定には約8k推論トークンが必要だった。
あなたへの影響
Qwen3.8 27Bをローカル運用する日本のエンジニアは、まずGPU容量とKV-cacheを合わせてQ4_K_Mを次スプリントで検証し、品質要件をベンチマークで確認すべきです。
推奨:量子化でモデル本体を縮めてもKV-cacheにはF16で32kトークン当たり約2.3GB必要なため、コンテキスト長を含めて容量を見積もってください。