注目★★★★★Hugging Face Papers
教師なし自己蒸留で LLM を強化、監督信号ゼロで数学問題解析精度 8~11% 向上
30秒で把握
- 1教師データなしで自己蒸留、複数生成の一貫性から疑似解を構築し自己補正を実現
- 2Qwen3 (4B/8B) 数学ベンチで 8.5~10.7% 精度向上、既存監督手法 OPSD を 2.3~3.2% 上回る
- 3思考モードで OPSD と同等以上の性能達成、正解ラベル依存から解放された蒸留学習の新パラダイム
要約
研究チームは外部の正解信号や環境フィードバックに頼らない自己蒸留手法 U-OPSD を提案した。複数の生成結果から内部一貫性を用いて疑似解を構築し、モデルが自信を持って間違えた部分を蒸留により補正する仕組みで、教師なし学習を実現する。AIME・HMMT・MATH500 など 5 つの数学ベンチマークで Qwen3 (4B/8B) はベースモデル比 8.5~10.7% の精度向上を達成し、正解データを使う既存手法 OPSD と比較しても平均で 2.3~3.2% 上回った。
あなたへの影響
数学推論特化だが教師なし蒸留が有効と示されたため、大規模言語モデルの継続学習コストを低減できる可能性がある。
推奨:ファインチューニングやポストトレーニングで正解ラベル収集が負担になっているチームは、内部一貫性ベースの疑似ラベル生成手法を試験的に評価する価値がある。