注目★★★★★Hugging Face Papers
科学ソフトウェアの修復ベンチマーク SWE-bench Science、AI コーディングエージェントの限界が明らかに
30秒で把握
- 1SWE-bench Science は科学ソフトウェア 119 タスク・20 科学領域・3 修復パラダイムで構成。最強 AI (Claude Opus-5) でも pass@1 は 50% 未満。
- 24 つの共通障害: 科学知識不足・表層修復・システム統合不完全・知識般化失敗。AI の推論限界が実証される。
- 3科学的ガイダンスは必ずしも効果的でない。根拠ある指導は効率改善するが不正確な指導は認知バイアスを招く。
要約
Hugging Face は科学ソフトウェア修復タスク 119 題を収録するベンチマーク SWE-bench Science を公開した。生物学・化学・物理学など 20 科学領域の 98 リポジトリから出題され、Issue 駆動型・専門家検証型・エンジニアリング統合型の 3 パラダイムに分類される。最高性能の Claude Code with Opus-5 でも pass@1 は 50% 未満に止まった。分析から、科学知識の不足・表層的な修復・不完全なシステム統合・観察外への知識般化失敗という 4 つの共通障害パターンが判明した。明確な科学的指導を除去した実験では、適切に根拠づけられた情報は修復を制約しトークン効率を改善する一方、不適切なガイダンスは認知バイアスを誘発することが示された。
あなたへの影響
科学研究の検証可能性がソフトウェア品質に依存する現状、AI コーディングエージェント単体では科学知識を正確に統合できない課題が浮き彫りになった。
推奨:科学計算ライブラリやデータ解析パイプラインを運用するチームは、AI 支援の検証段階で科学的な仮説検証を強化し、自動修復に依存しすぎないプロセス設計への検討が必要になる可能性がある。