注目★★★★★Hugging Face Papers
AREX:深い研究を自分で検証・改良する AI エージェント、4B と 122B MoE で実装
30秒で把握
- 1AREX が再帰的自己改良 (RSI) で深い研究を実現・4B と 122B MoE 版を訓練完了
- 2証拠と制約を交互に検証・未解決部分を標的化した追加研究で答えの質を高める
- 3長期 RL と圧縮コンテキスト更新ツールで自動研究の信頼度と効率を向上
要約
Hugging Face の研究チームは、AREX という再帰的自己改良 (RSI) エージェントファミリーを発表した。深い研究では複数の制約を同時に満たす答えを見つけることが難しい一方で、候補を検証することは個別の制約チェックに分解できるという非対称性に着目した。AREX は内側のループで証拠を集めて仮の答えを構築し、外側のループでその答えを制約ごとに監査して未解決の主張を特定し、標的化した追加研究を実行する。長期間の RSI を維持するため、相互作用履歴を検証済み証拠と未解決制約を保存した圧縮状態に変換する自律的なコンテキスト更新ツールを学習させた。エージェント中間学習と長期 RL により 4B 版と 122B-A10B Mixture-of-Experts 版を訓練した。
あなたへの影響
この記事が日本のエンジニアに与える影響と、今日取るべきアクションは、Personal会員向けに掲載しています。
クレカ不要・いつでも解約