注目★★★★★Hugging Face Papers
NeoHorse-1、4Bモデルを58.94から64.87へ改善
30秒で把握
- 1NeoHorse-1がRouting連動のPost-Trainingで再帰的自己改善を実装
- 211ベンチマークで4Bは58.94から64.87、9Bは65.60から69.04へ上昇
- 3推論・Tool Call・Harness文脈を3段階学習と蒸留へ反映
要約
NeoHorse-1は、インテリジェントなRoutingとAgentic Post-Trainingで再帰的自己改善を目指すモデル群を公開した。異種モデル群への振り分け、推論・Tool Call・Harness文脈を含む記録、3段階カリキュラム、Routing誘導のOn-Policy蒸留を組み合わせる。評価結果を次の学習データ配分へ戻すEvaluation-Selection-Updateループで、11ベンチマークのマクロ平均は4Bモデルが58.94から64.87、9Bモデルが65.60から69.04に上昇した。学習後の4Bモデルは9Bベースモデルとの差を大幅に縮めた。
あなたへの影響
Agentベースのモデル開発チームは、Routingログと評価結果を学習データへ戻す仕組みを次の実験計画で検証する価値がある。
推奨:Harnessはツール呼び出しや実行環境を含むエージェント用の制御基盤を指す。