Asayomu Tech
注目★★★★Hugging Face Papers

LLMエージェントの失敗を反映するAutoSaddler、3ベンチで最大10.0ポイント改善

30秒で把握

  • 1AutoSaddler が失敗トレースから LLM ハーネスを自動改良
  • 2GAIA2・SWE-Bench Pro・Terminal-Bench 2.0 で9.0〜10.0ポイント向上
  • 3深いデバッグと対象限定の変更、汎化重視の更新選択が有効

要約

AutoSaddlerは、LLMエージェントの実行失敗を使ってハーネスを自動改良する最適化フレームワークだ。失敗トレースの診断、ハーネスをコードとして扱う構造化パッチ生成、検証に基づく更新選択をオフライン学習として反復する。GAIA2、SWE-Bench Pro、Terminal-Bench 2.0で、ベースハーネス比の性能をそれぞれ9.0、9.6、10.0ポイント改善した。分析では、浅い振り返りではなく深いデバッグ、無制限編集ではなく対象を絞った変更、軌跡固有の修正ではなく汎化を考慮した選択が有効だった。

あなたへの影響

LLMエージェントを長時間タスクで運用するチームは、既存ハーネスに失敗トレース診断と検証付き更新を組み込めるか、次の評価サイクルで検証すべきだ。

推奨:失敗した軌跡だけに合わせた修正は汎化しない可能性があるため、複数タスクでの再評価が必要になる。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。