Asayomu Tech
注目★★★★Hugging Face Papers

TTPO、ラベルなしTTTでQwen3-1.7Bを45.2%へ

30秒で把握

  • 1TTPOが正解ラベルなしの数学推論向けテスト時学習を実現
  • 2Qwen3-1.7BのTTT性能を38.0%から45.2%へ向上
  • 3一致出力をOPSDで蒸留し不一致の確信誤りをGrouped RLで抑制

要約

研究チームは、正解ラベルなしで数学推論モデルをテスト時学習するTest-Time Policy Optimization(TTPO)を提案した。多数決に一致する出力はOn-Policy Self-Distillation(OPSD)で蒸留し、不一致の出力はGrouped RLで罰する非対称目的を採用した。トークン単位で、蒸留では収束済み位置の重みを下げ、RLでは確信度の高い誤りだけを罰する。5つの競技レベルベンチマークで、ラベル教師ありOPSDと同等の性能を達成した。テスト時学習ではQwen3-1.7Bを38.0%から45.2%に向上させ、thinkingなしでも25.2〜36.4%の改善幅を得た。

あなたへの影響

数学推論モデルを運用時に適応させるチームは、正解ラベルを用意できない環境でTTPOの再現性と計算コストを次スプリントで検証すべき。

推奨:多数決によるpseudo-labelは誤り得るため、評価では誤ラベル時の性能劣化も確認したい。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。