注目★★★★★Hugging Face Papers
Coding Agentの設計要素、176条件で効果を比較
30秒で把握
- 1176条件でCoding Agentのplanning・action space・context管理を比較
- 2context管理は予算が厳しいほど有効でoverflow失敗を防止
- 3bash対応モデルはbashのみで低コスト、弱いモデルは定義済みツールで性能向上
要約
本研究は、Coding Agentの性能を左右する計画、action space、context managementを部品単位で比較した。4モデルをSWE-Bench VerifiedとTerminal-Bench 2.1で評価し、176条件、5種類のcontext管理方式、4段階のcontext-window予算を検証した。context管理は予算が厳しいほど有効で、主な効果はcontext overflowによる失敗の防止だった。rule-based elision後にLLM要約を行う方式が最も効率的で、削除内容を復元可能にしても精度は向上しなかった。planningは弱いモデルでは精度を支え、強いモデルではコストを削減した。bashに弱いモデルは定義済みツールで性能が上がり、bash対応モデルはbashのみのインターフェースで低コストに動作した。
あなたへの影響
Coding Agentを開発・運用するチームは、モデルのbash能力とcontext-window予算に合わせて、context管理方式とツール構成を次の評価サイクルで比較すべきです。
推奨:context overflowを防ぐ仕組みと、タスク別の精度・コストを測る評価基盤が重要になります。