注目★★★★★Hugging Face Papers
J-Zero、データなしの共進化でLLMを10回以上改善
30秒で把握
- 1J-ZeroがChallenger・Solver・Judgeの共進化でLLM自己改善を実現
- 2検証可能領域で4.2ポイント、検証不可能領域で8.0ポイント上回る
- 310回以上改善継続、ベースラインは2回後に性能低下
要約
J-Zeroは、Challenger・Solver・Judgeを敵対的に共進化させ、検証可能・不可能な両領域で言語モデルを自己改善する枠組みだ。Challengerが難しい課題を生成し、Solverが回答品質を高める。Judgeは自身のスコアではなく、生成過程から順序が既知の選好ペアで適応する。ベースラインを検証可能領域で平均4.2ポイント、検証不可能領域で8.0ポイント上回り、少なくとも10回の反復で改善を続けた一方、ベースラインは2回後に低下した。
あなたへの影響
LLMの研究・評価チームは、検証不可能なタスクを含む自己改善手法としてJ-Zeroを次の評価候補に加え、反復回数ごとの性能推移を検証するとよい。
推奨:Judgeの選好を生成過程から構成する手法で、外部評価データへの依存を抑える可能性がある。