注目★★★★★Hugging Face Papers
PILOT、実行中のAgentを修正し精度14.6ポイント向上
30秒で把握
- 1PILOT が実行中のAgentを誘導・中断し自己改善を実現
- 2GLM-5.1で14.6点、Kimi-K2.6で12.4点の性能向上
- 3平均出力Tokenを最大47.4%削減し成功評価数を最大134.0%増加
要約
PILOTは、実行中のAgentを監督役が誘導・中断し、得られた手順や失敗例を再利用可能なSkillとMemoryへ変換するSupervisor-Worker型のHarnessを提案した。実行後に経験を処理する従来手法と異なり、現在のタスクと将来の実行を同時に改善する。固定したGLM-5.1とKimi-K2.6を用いた3ベンチマークで、6構成中5構成で首位を獲得した。Terminal-Bench 2.0では既存Harnessを最大9.8ポイント上回り、自己改善設定でGLM-5.1は14.6ポイント、Kimi-K2.6は12.4ポイント向上した。平均出力Tokenはそれぞれ42.9%、47.4%減少し、100万出力Token当たりの成功評価数は110.3%、134.0%増加した。
あなたへの影響
長時間Agentを開発するチームは、PILOTのSupervisorによる実行中介入とSkill蓄積を次スプリントで検証し、精度だけでなくToken削減効果も測定すべきです。
推奨:実運用では介入による遅延や誤誘導の影響も評価項目に加える必要があります。