Asayomu Tech
注目★★★★★Hugging Face Papers

D³-MOPD、動的配分で蒸留のロールアウトを約3分の1に

30秒で把握

  • 1D³-MOPD がMOPDのドメイン配分を動的化し性能差の97%を解消
  • 2Qwen3.6-35B-A3Bと4教師で検証しロールアウト手順数を約3分の1に削減
  • 37ベンチマーク中3つで専門教師を上回り固定配分の非効率を改善

要約

D³-MOPDは、複数のドメイン専門教師から学生モデルへ行うMOPDのドメイン配分を、学習中に動的調整する手法だ。学習済みのドメイン別reverse-KL軌跡から収束余地と改善速度を推定し、オフプロセスの監視役がサンプリング比率を更新する。Qwen3.6-35B-A3Bを4人の専門教師から蒸留した実験では、学生と教師の平均性能差を97%埋め、従来のMOPDの63%を上回った。同じピーク性能に必要なロールアウト手順数も約3分の1に減り、7ベンチマーク中3つで専門教師を上回った。

あなたへの影響

MOPDを運用する日本のエンジニアは、既存のドメイン別reverse-KLログを使った動的配分を次の評価候補に加えるとよい。

推奨:ドメインごとの収束速度に差が大きいほど、固定配分よりロールアウト削減につながり得るため、まず同一ピーク性能までの手順数を比較すべきだ。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。