注目★★★★★Hugging Face Blog
GPT-OSS 60B、4-bit化後に7/9ベンチでbfloat16超え
30秒で把握
- 1QAH適用のGPT-OSS 60Bが同じbfloat16版を9ベンチ中7つで上回った
- 2AA-LCRで7.4点、AIME 2025で5.6点向上しLiveCodeBenchは66.5を記録
- 3QAHは約100ステップでピーク到達、QATは1200ステップで約19点低下
要約
Multiverse Computing は、構造圧縮と量子化を受けたLLMを元のモデルから再蒸留するQuantization-Aware Healing(QAH)を提案した。GPT-OSS 120Bを60Bパラメータへ圧縮しMXFP4化したモデルは、同じ60Bのbfloat16版を9ベンチマーク中7つで上回った。AA-LCRで7.4点、AIME 2025で5.6点向上し、元の120B教師モデルにもLiveCodeBenchで66.5対66.0と勝った。9Bモデルの比較ではQAHが約100ステップで54.9に到達し、QATの約700ステップより速く、QATが1200ステップで約19点低下したのに対し性能を維持した。4-bit化によりbfloat16版の約4分の1の重みメモリで動作する。
あなたへの影響
LLMを圧縮・量子化して運用する日本の開発チームは、QATだけでなくQAHを候補に加え、既存モデルで精度と学習安定性を比較検証するとよい。
推奨:QAHは元の全精度モデルを教師にする蒸留手法で、長文脈ではchunked KL lossを使う。