Asayomu Tech
注目★★★★Hacker News

Ornith-1.5、自己改善ループで自動スケーリング—397B MoE が Claude Opus 4.8 に並ぶ

30秒で把握

  • 1Ornith-1.5 が自己生成タスク・スキャフォルド・報酬を統合した閉ループ自己改善を実装・97B MoE は Claude Opus 4.8 に性能並ぶ
  • 235B MoE は 3B 活性化で Gemini・Qwen を大幅上回る効率・9B はモバイル展開可能で 30B+ モデルを超過
  • 3有効性・難易度・多様性を乗算結合した報酬で自動カリキュラム進化・推論・エージェント・コード生成で実用的性能確認

要約

Ornith-1.5 は自己生成タスク・スキャフォルディング・ソリューションを組み合わせた閉ループ自己改善フレームワークで、モデルが新規学習経験を継続的に生成できる。397B MoE は Terminal-Bench 2.1 で 86.1・DeepSWE で 56.0 を達成し Claude Opus 4.8 (85.0・59.0) に並び、同規模オープンソースモデルの GLM-5.2・DeepSeek-V4-Flash-0731 を上回る。35B MoE は 3B パラメータのみ活性化しながら Gemini・Qwen の同規模モデルを大幅上回り、9B 版は iPhone・Android 端末への展開を実現しつつ 30B 超級モデルをしのぐ。タスク難易度・有効性・多様性を同時に最適化する報酬設計で、モデルの能力向上に応じて自動的にカリキュラムが進化する。

あなたへの影響

自己改善ループが人間キュレーション依存を減らし、推論・エージェント・コーディング全域で実用的な性能を達成している点が重要。オープンソースの 9B・35B・397B モデルから選択できるため、自社インフラ・エッジデバイス・大規模クラウド各層での運用検討が可能になる。

推奨:GRPO を用いた報酬設計の細部(Validity・Frontier Difficulty・Novelty の乗算型結合)は構造化タスク生成の参考になるが、同じ効果が自社タスク領域で得られるかは実装・検証が必要。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。