注目★★★★★Hugging Face Papers
ProgramDistill、26アプリから4,063件のSWE評価タスクを自動生成
30秒で把握
- 1ProgramDistill が26アプリから4,063件のSWE評価タスクを自動構築
- 21,975件の再生検証済み挙動を抽出し人手なしでタスク化
- 3GPT-6 Astra 49.2%、Claude Opus 5 28.8%の完全再構築成功率
要約
Microsoftは、動作するWebアプリを操作して機能を推測し、不完全なアプリへ実装するコーディングエージェント向けベンチマーク「ProgramDistill」を発表した。26アプリから1,975件の再生検証済み挙動を抽出し、人手を介さず4,063タスクを構築した。9種類のエージェントによる完全再構築では、GPT-6 Astraが49.2%、Claude Opus 5が28.8%の累積ワークフロー成功率を達成した。部分再構築では復元深度を1から8へ上げると、成功率がGPT-6 Astraで100%から64.0%、Claude Opus 5で96%から32%へ低下した。難易度を制御でき、評価と失敗診断、将来のカリキュラム学習に使えるベンチマークとなる。
あなたへの影響
コーディングエージェントを評価するチームは、指示文だけでなく参照アプリの挙動再現を含むテスト設計を検討すべきで、ProgramDistillの公開後は既存評価との結果差を検証するとよい。
推奨:挙動の再生検証とは、参照アプリで確認した操作結果を自動テストとして再実行する仕組みである。