Asayomu Tech
注目★★★★★Hugging Face Papers

Coding Agentの設計要素、176条件で効果を比較

30秒で把握

  • 1176条件でCoding Agentのplanning・action space・context管理を比較
  • 2context管理は予算が厳しいほど有効でoverflow失敗を防止
  • 3bash対応モデルはbashのみで低コスト、弱いモデルは定義済みツールで性能向上

要約

本研究は、Coding Agentの性能を左右する計画、action space、context managementを部品単位で比較した。4モデルをSWE-Bench VerifiedとTerminal-Bench 2.1で評価し、176条件、5種類のcontext管理方式、4段階のcontext-window予算を検証した。context管理は予算が厳しいほど有効で、主な効果はcontext overflowによる失敗の防止だった。rule-based elision後にLLM要約を行う方式が最も効率的で、削除内容を復元可能にしても精度は向上しなかった。planningは弱いモデルでは精度を支え、強いモデルではコストを削減した。bashに弱いモデルは定義済みツールで性能が上がり、bash対応モデルはbashのみのインターフェースで低コストに動作した。

あなたへの影響

Coding Agentを開発・運用するチームは、モデルのbash能力とcontext-window予算に合わせて、context管理方式とツール構成を次の評価サイクルで比較すべきです。

推奨:context overflowを防ぐ仕組みと、タスク別の精度・コストを測る評価基盤が重要になります。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。