Asayomu Tech
注目★★★★★Hugging Face Papers

Claw-SWE-Bench: エージェント評価の多言語ベンチマーク公開

30秒で把握

  • 1Claw-SWE-Bench公開: 8言語・350インスタンスの多言語コーディングエージェント評価基準
  • 2フルアダプタでPass@1が73.4%、最小構成の19.1%から大幅に向上(GLM 5.1使用)
  • 3モデル選択で±29.4pp・ハーネス選択で±27.4pp変化しAPIコストにも大きな差

要約

Claw-SWE-Benchは、OpenClawのような汎用エージェントのコーディング能力を公平に評価するための多言語ベンチマークおよびアダプタプロトコルとして公開された。8言語・43リポジトリにわたる350件のGitHub Issue解決インスタンスを含み、軽量版の80インスタンス「Lite」版も提供される。最小アダプタ構成ではPass@1が19.1%にとどまるが、フルアダプタ構成では同一モデル(GLM 5.1)で73.4%に達し、アダプタ設計の重要性が判明した。モデル選択はPass@1を最大29.4ポイント、ハーネス選択は27.4ポイント変化させ、精度が近いシステムでもAPIコストが大きく異なることも確認された。

あなたへの影響

コーディングエージェントの評価基盤を自社で整備しているチームは、ハーネス設計とモデル選定がスコアとコストの両方に与える影響を定量的に把握するうえで参考になる。

推奨:即時アクションは不要だが、SWE-bench系の評価を行う際にプロトコル統一の指針として活用できる。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。