注目★★★★★Hugging Face Papers
D³-MOPD、動的配分で蒸留のロールアウトを約3分の1に
30秒で把握
- 1D³-MOPD がMOPDのドメイン配分を動的化し性能差の97%を解消
- 2Qwen3.6-35B-A3Bと4教師で検証しロールアウト手順数を約3分の1に削減
- 37ベンチマーク中3つで専門教師を上回り固定配分の非効率を改善
要約
D³-MOPDは、複数のドメイン専門教師から学生モデルへ行うMOPDのドメイン配分を、学習中に動的調整する手法だ。学習済みのドメイン別reverse-KL軌跡から収束余地と改善速度を推定し、オフプロセスの監視役がサンプリング比率を更新する。Qwen3.6-35B-A3Bを4人の専門教師から蒸留した実験では、学生と教師の平均性能差を97%埋め、従来のMOPDの63%を上回った。同じピーク性能に必要なロールアウト手順数も約3分の1に減り、7ベンチマーク中3つで専門教師を上回った。
あなたへの影響
MOPDを運用する日本のエンジニアは、既存のドメイン別reverse-KLログを使った動的配分を次の評価候補に加えるとよい。
推奨:ドメインごとの収束速度に差が大きいほど、固定配分よりロールアウト削減につながり得るため、まず同一ピーク性能までの手順数を比較すべきだ。