注目★★★★★Hugging Face Papers
SWE-Bench ProMax: 7言語対応、170タスク・マルチファイル規模リファクタリング評価ベンチ
30秒で把握
- 1HuggingFace が SWE-Bench ProMax 公開・7 言語 170 タスク・リファクタリング専門ベンチ
- 2従来ベンチ 60% にテスト不備・モデルの学習データ再現を検証・問題記述全改稿で品質向上
- 3平均 11.4 ファイル・262 行規模で実務接近度が高く・エージェント選定評価に活用可能
要約
HuggingFace は SWE-Bench ProMax を公開し、AI コーディングエージェント向けの厳選マルチリンガルコード リファクタリングベンチマークを提供した。170 の実運用コミットから抽出した Python / Java / TypeScript / Go / C / C++ / Rust 対応タスクで、平均 11.4 ファイル・262 行の規模を持ち、既存 SWE-Bench 比で大幅に複雑化している。従来ベンチ (SWE-Bench Verified) は約 60% のタスクにテスト不備 (過度に狭い or 広い仕様) があり、モデルが学習データから逐語的にパッチを再現する問題が判明したため、本ベンチは問題記述を全改稿し、テストスイートを手作業で厳査して品質向上を実現した。
あなたへの影響
AI コーディングエージェントを本番導入するチームは、既存 SWE-Bench の品質低下と学習データ漏洩問題を踏まえ、本ベンチで自社実装モデルの実力を再評価する価値がある。
推奨:マルチファイル・マルチ言語リファクタリングは実務に近い難度であり、エージェント選定や社内導入判断の根拠として活用できる。