注目★★★★★Hugging Face Papers
複数 AI が互いに教え合う「Co-RL」、教師データなしに推論能力が自動成長
30秒で把握
- 1複数モデルが互いの出力を評価する Co-RL フレームワーク提案・教師データなしに推論性能向上を実証
- 2異なるサイズ・アーキテクチャ・データのコホート多様性により相関エラー削減・学習崩壊を回避
- 3テキスト・マルチモーダルで教師あり手法と同等以上の性能達成・自己報酬学習の均質化問題を解決
要約
Hugging Face の研究チームは、複数の独立した言語モデルが互いの出力を評価して報酬信号を生成し、協調学習する枠組み「Co-RL」を提案した。単一モデルの自己報酬学習は既存バイアスを増幅し応答の均質化につながるが、異なるモデルサイズ・学習データ・アーキテクチャを組み合わせた多様なコホートを用いることで、相関エラーを削減し推論性能を向上させた。テキスト・マルチモーダル両領域で教師あり学習と同等かそれ以上の性能を、人間ラベルなしに達成した。
あなたへの影響
自社の LLM 運用チームは、現状の自己報酬学習で応答が単調化・固定化する場合、複数モデルの並列学習による多様性確保の有効性を評価する価値がある。
推奨:推論能力の継続的な改善に外部ラベルが必須ではないことが示され、スケーラビリティに直結し得る。