Asayomu Tech
注目★★★★Hugging Face Papers

Prime Agent:言語モデルを自己改善する統合フレームワーク、ARC-AGI スコア 30% から 95.5% へ

30秒で把握

  • 1Prime Agent(オープンソース)が永続 REPL・再帰サブエージェント・メモリ保存を統合し、ARC-AGI 30%→95.5%、長文コンテキストと並列化タスクで既存ハーネスを超過
  • 2ハーネス設計がモデル評価値に直結・失敗がモデルの問題でなく環境設計の問題と判明・測定精度がモデル真の能力を反映するようになった
  • 3長時間エージェントタスクの評価フレームワークとして GitHub で公開・既存ベンチマーク停滞時は環境刷新を検討対象に

要約

Prime Agent は、言語モデルが長時間の複雑なタスクに取り組むための統合フレームワークを公開した。永続的な IPython REPL と Recursive Language Model 抽象化により、テスト時の計算と段階的なコンテキスト処理を実現する。複数の再帰的サブエージェント間の直接通信、ヒストリー・スキル・プロンプトの保存により、タスク横断的な状態管理と協調作業を可能にした。ARC-AGI-3 ベンチマークで 30% から 95.5% へスコアを向上させ、長文コンテキスト処理、GPU カーネル生成、エミュレータ構築、Factorio での自動化タスク評価において既存ハーネスに匹敵または超過した。

あなたへの影響

Prime Agent が ARC-AGI スコアを大幅に向上させた理由は「モデルの欠陥ではなく、ハーネス(実行環境)の制限だった」ことを示唆しており、今後のエージェント研究では評価フレームワークの設計がモデル性能の見積もりを大きく左右する可能性がある。

推奨:既存の LLM ベンチマークで成績が伸び悩んでいる場合、評価環境の刷新を検討する価値が出てくる。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。