Asayomu Tech
注目★★★★★Hugging Face Blog

GPT-OSS 60B、4-bit化後に7/9ベンチでbfloat16超え

30秒で把握

  • 1QAH適用のGPT-OSS 60Bが同じbfloat16版を9ベンチ中7つで上回った
  • 2AA-LCRで7.4点、AIME 2025で5.6点向上しLiveCodeBenchは66.5を記録
  • 3QAHは約100ステップでピーク到達、QATは1200ステップで約19点低下

要約

Multiverse Computing は、構造圧縮と量子化を受けたLLMを元のモデルから再蒸留するQuantization-Aware Healing(QAH)を提案した。GPT-OSS 120Bを60Bパラメータへ圧縮しMXFP4化したモデルは、同じ60Bのbfloat16版を9ベンチマーク中7つで上回った。AA-LCRで7.4点、AIME 2025で5.6点向上し、元の120B教師モデルにもLiveCodeBenchで66.5対66.0と勝った。9Bモデルの比較ではQAHが約100ステップで54.9に到達し、QATの約700ステップより速く、QATが1200ステップで約19点低下したのに対し性能を維持した。4-bit化によりbfloat16版の約4分の1の重みメモリで動作する。

あなたへの影響

LLMを圧縮・量子化して運用する日本の開発チームは、QATだけでなくQAHを候補に加え、既存モデルで精度と学習安定性を比較検証するとよい。

推奨:QAHは元の全精度モデルを教師にする蒸留手法で、長文脈ではchunked KL lossを使う。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。