注目★★★★★Hugging Face Papers
LLMエージェントの失敗を反映するAutoSaddler、3ベンチで最大10.0ポイント改善
30秒で把握
- 1AutoSaddler が失敗トレースから LLM ハーネスを自動改良
- 2GAIA2・SWE-Bench Pro・Terminal-Bench 2.0 で9.0〜10.0ポイント向上
- 3深いデバッグと対象限定の変更、汎化重視の更新選択が有効
要約
AutoSaddlerは、LLMエージェントの実行失敗を使ってハーネスを自動改良する最適化フレームワークだ。失敗トレースの診断、ハーネスをコードとして扱う構造化パッチ生成、検証に基づく更新選択をオフライン学習として反復する。GAIA2、SWE-Bench Pro、Terminal-Bench 2.0で、ベースハーネス比の性能をそれぞれ9.0、9.6、10.0ポイント改善した。分析では、浅い振り返りではなく深いデバッグ、無制限編集ではなく対象を絞った変更、軌跡固有の修正ではなく汎化を考慮した選択が有効だった。
あなたへの影響
LLMエージェントを長時間タスクで運用するチームは、既存ハーネスに失敗トレース診断と検証付き更新を組み込めるか、次の評価サイクルで検証すべきだ。
推奨:失敗した軌跡だけに合わせた修正は汎化しない可能性があるため、複数タスクでの再評価が必要になる。