Asayomu Tech
注目★★★★Hugging Face Papers

LoopArena、Coding Agent制御の厳密成功率は24.69%

30秒で把握

  • 1LoopArena がControllerによる長期Coding Agent制御を評価
  • 2全タスクの最高Strict Success Rateは24.69%にとどまる
  • 3Type IIは推定推論コスト64.4%削減・順位相関ρ=0.9747

要約

LoopArena は、別のCoding Agentを長時間タスク中に指揮するControllerモデルの性能を測るベンチマークとして公開された。Controllerは各ラウンド後の実行要約を受け、Workerに次の作業や検証を指示するか、停止を決める。評価はWorkerを実行しないType I、タスクの一部を反復制御するType II、初期状態から全タスクを評価するType IIIで構成する。全タスクの最高Strict Success Rateは24.69%にとどまり、長期的なループ制御に改善余地を残した。一方、推定推論コストは平均64.4%削減され、Type IIのモデル順位は全タスク評価と高い相関を示した(Spearmanのρ=0.9747)。

あなたへの影響

Coding Agentのループを設計・運用するチームは、最終成否だけでなくControllerの判断単位と検証結果をType IIで評価し、低コストに制御方針を比較すべきです。

推奨:Controllerは作業指示と停止判断を担うモデル、Workerは実装を担う固定モデルです。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。