注目★★★★★Hugging Face Papers
OPDはデータより遅い?1例で98.9%の状態をカバー
30秒で把握
- 1研究チームがOPDを1クエリで検証しデータ過剰・学習不足と結論
- 2単一クエリで状態カバレッジ71.5%、16クエリで98.9%に到達
- 316クエリのMOPDが全データ学習と一致、課題内容と状態範囲が分離
要約
研究チームは、on-policy distillation(OPD)がデータ不足ではなく学習効率に制約されると論じた。1つのクエリでも数百ステップ改善し、全データOPDの性能向上の大部分を回復した。単一クエリは全データが訪れる状態の71.5%を到達し、16個の意味的に異なるクエリでは98.9%に達して全データ学習と一致した。一方、教師へのアライメントは1クエリでも全データでも同様に遅く、固定した状態の吸収にも数百ステップを要した。この傾向はマルチ教師OPDにも及び、ドメインごとに16クエリで全データMOPDに一致した。
あなたへの影響
LLMのポストトレーニングを設計するチームは、データ追加よりもOPDのステップ効率を優先し、少数クエリでの収束と状態カバレッジを次スプリントで検証すべき。
推奨:状態カバレッジは、ロールアウトが全データ学習で訪れる状態をどれだけ再現するかを表す指標で、タスク内容と切り離して評価できる可能性がある。