Asayomu Tech
注目★★★★Hugging Face Papers

教師なし自己蒸留で LLM を強化、監督信号ゼロで数学問題解析精度 8~11% 向上

30秒で把握

  • 1教師データなしで自己蒸留、複数生成の一貫性から疑似解を構築し自己補正を実現
  • 2Qwen3 (4B/8B) 数学ベンチで 8.5~10.7% 精度向上、既存監督手法 OPSD を 2.3~3.2% 上回る
  • 3思考モードで OPSD と同等以上の性能達成、正解ラベル依存から解放された蒸留学習の新パラダイム

要約

研究チームは外部の正解信号や環境フィードバックに頼らない自己蒸留手法 U-OPSD を提案した。複数の生成結果から内部一貫性を用いて疑似解を構築し、モデルが自信を持って間違えた部分を蒸留により補正する仕組みで、教師なし学習を実現する。AIME・HMMT・MATH500 など 5 つの数学ベンチマークで Qwen3 (4B/8B) はベースモデル比 8.5~10.7% の精度向上を達成し、正解データを使う既存手法 OPSD と比較しても平均で 2.3~3.2% 上回った。

あなたへの影響

数学推論特化だが教師なし蒸留が有効と示されたため、大規模言語モデルの継続学習コストを低減できる可能性がある。

推奨:ファインチューニングやポストトレーニングで正解ラベル収集が負担になっているチームは、内部一貫性ベースの疑似ラベル生成手法を試験的に評価する価値がある。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。