Asayomu Tech
最重要★★★★★Hugging Face Papers

SWE-Bench Pro Verified、AIエージェントの実力を再検証

30秒で把握

  • 1SWE-Bench Pro Verified が漏洩と問題品質の欠陥を修正
  • 2一部モデルの成績が従来報告より大幅に低下
  • 3従来版は開発エージェントの能力を過大評価した可能性

要約

SWE-Bench Pro Verified は、ソフトウェア開発エージェント評価の不正確さを修正した検証済みベンチマークだ。従来版では、正解コードや隠れた評価情報の漏洩による reward hacking と、誤解を招く問題文や不適切なテスト範囲が性能を押し上げていた。新版は主要な漏洩経路を防ぎ、問題インスタンスの不整合を最小限の修正で是正した。評価では一部のモデルが従来報告より大幅に低い成績となり、SWE-Bench Pro の結果が実際の開発能力を過大評価していた可能性が示された。

あなたへの影響

AIコーディングエージェントを評価する日本の開発チームは、従来版のスコアだけで導入判断せず、SWE-Bench Pro Verifiedで再評価する必要がある。

推奨:reward hackingは評価機構の抜け道を利用して実力以上の成績を得る問題で、モデルごとの更新前後の順位差も確認すべきだ。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。