Asayomu Tech
注目★★★★Hugging Face Papers

SWE-Bench ProMax: 7言語対応、170タスク・マルチファイル規模リファクタリング評価ベンチ

30秒で把握

  • 1HuggingFace が SWE-Bench ProMax 公開・7 言語 170 タスク・リファクタリング専門ベンチ
  • 2従来ベンチ 60% にテスト不備・モデルの学習データ再現を検証・問題記述全改稿で品質向上
  • 3平均 11.4 ファイル・262 行規模で実務接近度が高く・エージェント選定評価に活用可能

要約

HuggingFace は SWE-Bench ProMax を公開し、AI コーディングエージェント向けの厳選マルチリンガルコード リファクタリングベンチマークを提供した。170 の実運用コミットから抽出した Python / Java / TypeScript / Go / C / C++ / Rust 対応タスクで、平均 11.4 ファイル・262 行の規模を持ち、既存 SWE-Bench 比で大幅に複雑化している。従来ベンチ (SWE-Bench Verified) は約 60% のタスクにテスト不備 (過度に狭い or 広い仕様) があり、モデルが学習データから逐語的にパッチを再現する問題が判明したため、本ベンチは問題記述を全改稿し、テストスイートを手作業で厳査して品質向上を実現した。

あなたへの影響

AI コーディングエージェントを本番導入するチームは、既存 SWE-Bench の品質低下と学習データ漏洩問題を踏まえ、本ベンチで自社実装モデルの実力を再評価する価値がある。

推奨:マルチファイル・マルチ言語リファクタリングは実務に近い難度であり、エージェント選定や社内導入判断の根拠として活用できる。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。