注目★★★★★Hugging Face Papers
TTPO、ラベルなしTTTでQwen3-1.7Bを45.2%へ
30秒で把握
- 1TTPOが正解ラベルなしの数学推論向けテスト時学習を実現
- 2Qwen3-1.7BのTTT性能を38.0%から45.2%へ向上
- 3一致出力をOPSDで蒸留し不一致の確信誤りをGrouped RLで抑制
要約
研究チームは、正解ラベルなしで数学推論モデルをテスト時学習するTest-Time Policy Optimization(TTPO)を提案した。多数決に一致する出力はOn-Policy Self-Distillation(OPSD)で蒸留し、不一致の出力はGrouped RLで罰する非対称目的を採用した。トークン単位で、蒸留では収束済み位置の重みを下げ、RLでは確信度の高い誤りだけを罰する。5つの競技レベルベンチマークで、ラベル教師ありOPSDと同等の性能を達成した。テスト時学習ではQwen3-1.7Bを38.0%から45.2%に向上させ、thinkingなしでも25.2〜36.4%の改善幅を得た。
あなたへの影響
数学推論モデルを運用時に適応させるチームは、正解ラベルを用意できない環境でTTPOの再現性と計算コストを次スプリントで検証すべき。
推奨:多数決によるpseudo-labelは誤り得るため、評価では誤ラベル時の性能劣化も確認したい。