注目★★★★★Hugging Face Papers
Prime Agent:言語モデルを自己改善する統合フレームワーク、ARC-AGI スコア 30% から 95.5% へ
30秒で把握
- 1Prime Agent(オープンソース)が永続 REPL・再帰サブエージェント・メモリ保存を統合し、ARC-AGI 30%→95.5%、長文コンテキストと並列化タスクで既存ハーネスを超過
- 2ハーネス設計がモデル評価値に直結・失敗がモデルの問題でなく環境設計の問題と判明・測定精度がモデル真の能力を反映するようになった
- 3長時間エージェントタスクの評価フレームワークとして GitHub で公開・既存ベンチマーク停滞時は環境刷新を検討対象に
要約
Prime Agent は、言語モデルが長時間の複雑なタスクに取り組むための統合フレームワークを公開した。永続的な IPython REPL と Recursive Language Model 抽象化により、テスト時の計算と段階的なコンテキスト処理を実現する。複数の再帰的サブエージェント間の直接通信、ヒストリー・スキル・プロンプトの保存により、タスク横断的な状態管理と協調作業を可能にした。ARC-AGI-3 ベンチマークで 30% から 95.5% へスコアを向上させ、長文コンテキスト処理、GPU カーネル生成、エミュレータ構築、Factorio での自動化タスク評価において既存ハーネスに匹敵または超過した。
あなたへの影響
Prime Agent が ARC-AGI スコアを大幅に向上させた理由は「モデルの欠陥ではなく、ハーネス(実行環境)の制限だった」ことを示唆しており、今後のエージェント研究では評価フレームワークの設計がモデル性能の見積もりを大きく左右する可能性がある。
推奨:既存の LLM ベンチマークで成績が伸び悩んでいる場合、評価環境の刷新を検討する価値が出てくる。