注目★★★★★Hugging Face Papers
大学院レベルの数学証明、LLMはまだ 75% の正答率——AdvancedMathBench ベンチマーク公開
30秒で把握
- 1AdvancedMathBench 公開——大学院レベル 296 問の証明生成・検証ベンチマーク
- 2専門家アノテーション学習の自動検証パイプラインで証明の正確性と詳細エラー分類を評価
- 3GPT-5.5-xhigh でも学部課程 75.8%・博士試験 66.1%——高度な数学推論に改善余地が明確化
要約
研究者らは、大学院レベルの数学的推論能力を評価するベンチマークスイート「AdvancedMathBench」を公開した。コア部分の ProverBench は 296 問の証明問題を収録し、大学院博士試験レベルまでカバーしている。自動検証パイプラインは専門家アノテーションで学習し、証明の正確性と詳細なエラー分類を出力する。VerifierBench は 888 個のモデル生成証明と専門家の正解を対にし、モデルが証明の妥当性を判定できるか評価する。
あなたへの影響
LLM の数学的推論能力は業界でも重要な課題だが、本ベンチマークにより大学院レベルでの具体的な弱点が可視化されれば、自社で数学証明の自動化を検討するチームは要件定義で現実的な期待値の調整を迫られる可能性がある。
推奨:現時点で即時対応は不要です。必要に応じて原文を確認してください。