title: FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI paper_id: 'arXiv `2411.04872v7' year: '2025'
FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI¶
跳转:🌐 看原文 EN · 📖 看译文 ZH · 📄 看原文 PDF
笔记时间:2026-07-16 评分:0 领域:math 方法:— 类型:benchmark
元信息¶
- ID: arXiv
2411.04872v7 - 年份: 2025
- 作者: Elliot Glazer, Ege Erdil, Tamay Besiroglu, Diego Chicharro, Evan Chen, Alex Gunning 等
- 团队: Epoch AI;贡献数学家来自 King's College London、MIT、University of Siegen、ICMC/USP、UC Berkeley、Cornell、Harvard、University of Leicester、University of Bristol、Rutgers、ETH Zurich 等机构
- 本地 PDF:
paper.pdf - 解析文本:
main_en.md - 中文译文:
main_zh.md - 页数: 28
- 主题: research-level math benchmark, automatic verification, contamination control, math reasoning evaluation
摘要翻译¶
FrontierMath 是一个由专家数学家设计和审核的高难数学 benchmark,包含数百道原创、未公开、可自动验证答案的问题。题目覆盖现代数学多数分支,典型题需要相关领域研究者数小时解决,最高难度题需要数天。当前领先 AI 模型在完整 benchmark 上解题率低于 2%,说明 AI 与数学共同体在高级数学推理能力上仍有巨大差距。
定位¶
这篇论文不是提出新的数学推理模型,而是提出一个新的评测面:把数学 benchmark 从高中/竞赛题推进到研究级数学附近,同时保持自动评测和闭源 frontier model 可评估。
动机¶
现有数学 benchmark 有两个主要问题:
- MATH、GSM8K 等逐渐饱和,难以区分强模型。
- 历史竞赛题和公开题库容易进入训练集,带来数据污染。
FrontierMath 用原创未公开问题降低污染风险,用自动验证降低人工批改成本。
方法¶
- 60 多位数学家贡献题目,领域覆盖数论、组合数学、代数几何、群论、拓扑、范畴论、概率论等。
- 题目必须满足原创性、自动可验证、防猜测性、计算可处理性。
- 模型提交 Python 代码,将最终答案 pickle 到
final_answer.p;验证脚本检查整数、SymPy 对象或自定义答案条件。 - 每题至少经过一次 blind peer review;额外抽样 35 题做二次审查,用于估计错误率与 review 问题。
- 难度按 Background、Creativity、Execution 三个维度标注。
实验¶
- 被评测模型包括 o1-preview、o1-mini、GPT-4o、Claude 3.5 Sonnet、Grok 2 Beta、Gemini 1.5 Pro 002。
- 完整 benchmark 上没有模型达到 2% 成功率。
- 8 次运行平均准确率低于 2%;pass@8 下 o1-preview 约 6%,Grok 2 Beta 约 2%。
- 对任意模型至少解出过一次的 4 道题做重复评测,表现方差很大,只有 o1-preview 在其中一题上 5/5 成功。
- o1-preview 和 Gemini 1.5 Pro 002 常在没有代码实验反馈前提交最终答案;Grok 2 Beta 等模型使用更多交互轮次。
图表要点¶
- benchmark comparison 图显示 FrontierMath 仍有超过 98% 题目未被顶尖模型解决,核心证明它未饱和。
- verification_method 图说明 FrontierMath 的答案格式是“模型提交可验证对象”,不是提交自然语言证明。
- subjects_diagram 图说明题目常跨学科组合,数论、组合数学、群论是中心领域。
- experiment_loop 图说明评测允许模型用 Python 实验探索,不是一次性文本作答。
- model_comparison_mean_accuracy 与 pass@8 图共同说明当前模型绝对能力仍低,但重复采样能提高至少一次命中的概率。
局限¶
- 自动验证要求排除了大量证明写作和开放式探索问题。
- 题目虽然接近研究级,但仍被限制在数小时到数天,不等同于持续数月的真实研究。
- 当前模型解题率过低,短期内不利于细分模型强弱。
- 二次 review 发现 accepted problems 中仍可能有错误;论文估计关键错误率约 10% 是合理量级。
关系¶
FrontierMath 与 Hard2Verify 形成互补:FrontierMath 评估模型能否给出可自动验证的最终数学对象,Hard2Verify 评估模型能否逐步验证开放式证明。前者更适合闭源 frontier model 的高难数学最终答案评测,后者更适合训练/评估 verifier 与 process reward model。