注目★★★★★Hugging Face Papers
LLM製Agent Harness、生成と進化の実力を2,207件で検証
30秒で把握
- 1HarnessDev が LLM 自作Agent基盤の能力と効率を評価
- 26モデル・4分野・5ベンチマーク・2,207件で検証
- 3コードと検索では人手基盤に後れ、進化効果は不安定
要約
HarnessDev は、LLMがAgent Harnessを自作し、実行結果を基に改良できるかを測るベンチマークを公開した。Creationでは最小限の種から実行基盤を構築し、Evolutionでは自作Harnessを反復改良する。6つのcreator LLM、4分野、5ベンチマーク、2,207件の下流タスクで評価した。生成Harnessはコード、検索・調査で人手設計の成熟基盤に大きく及ばない一方、執筆と機械学習実験では選定された参照基盤に匹敵または上回った。改良による性能向上は不安定で、未見タスクへの転移は限定的だった。実行モデルを固定した実験では、成果がHarnessを実行するモデルに強く依存し、モデル間の転移が限られると分かった。
あなたへの影響
Agentを運用する日本のエンジニアは、モデル性能だけでなくHarnessの成功率と実行Tokenコストを分離して評価し、未見タスクと複数のruntime modelで検証すべきです。
推奨:Harnessの改良効果は実行モデルに依存する可能性があるため、単一モデルでの結果をそのまま本番設計に採用しない運用が必要です。