Asayomu Tech
注目★★★★Hugging Face Papers

NeoHorse-1、4Bモデルを58.94から64.87へ改善

30秒で把握

  • 1NeoHorse-1がRouting連動のPost-Trainingで再帰的自己改善を実装
  • 211ベンチマークで4Bは58.94から64.87、9Bは65.60から69.04へ上昇
  • 3推論・Tool Call・Harness文脈を3段階学習と蒸留へ反映

要約

NeoHorse-1は、インテリジェントなRoutingとAgentic Post-Trainingで再帰的自己改善を目指すモデル群を公開した。異種モデル群への振り分け、推論・Tool Call・Harness文脈を含む記録、3段階カリキュラム、Routing誘導のOn-Policy蒸留を組み合わせる。評価結果を次の学習データ配分へ戻すEvaluation-Selection-Updateループで、11ベンチマークのマクロ平均は4Bモデルが58.94から64.87、9Bモデルが65.60から69.04に上昇した。学習後の4Bモデルは9Bベースモデルとの差を大幅に縮めた。

あなたへの影響

Agentベースのモデル開発チームは、Routingログと評価結果を学習データへ戻す仕組みを次の実験計画で検証する価値がある。

推奨:Harnessはツール呼び出しや実行環境を含むエージェント用の制御基盤を指す。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。