注目★★★★★Hugging Face Papers
Claw-SWE-Bench: エージェント評価の多言語ベンチマーク公開
30秒で把握
- 1Claw-SWE-Bench公開: 8言語・350インスタンスの多言語コーディングエージェント評価基準
- 2フルアダプタでPass@1が73.4%、最小構成の19.1%から大幅に向上(GLM 5.1使用)
- 3モデル選択で±29.4pp・ハーネス選択で±27.4pp変化しAPIコストにも大きな差
要約
Claw-SWE-Benchは、OpenClawのような汎用エージェントのコーディング能力を公平に評価するための多言語ベンチマークおよびアダプタプロトコルとして公開された。8言語・43リポジトリにわたる350件のGitHub Issue解決インスタンスを含み、軽量版の80インスタンス「Lite」版も提供される。最小アダプタ構成ではPass@1が19.1%にとどまるが、フルアダプタ構成では同一モデル(GLM 5.1)で73.4%に達し、アダプタ設計の重要性が判明した。モデル選択はPass@1を最大29.4ポイント、ハーネス選択は27.4ポイント変化させ、精度が近いシステムでもAPIコストが大きく異なることも確認された。
あなたへの影響
コーディングエージェントの評価基盤を自社で整備しているチームは、ハーネス設計とモデル選定がスコアとコストの両方に与える影響を定量的に把握するうえで参考になる。
推奨:即時アクションは不要だが、SWE-bench系の評価を行う際にプロトコル統一の指針として活用できる。