title: 中文译文 · FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI paper_id: 'arXiv `2411.04872v7' year: '2025'
FrontierMath:用于评估 AI 高级数学推理能力的 Benchmark¶
中文结构化译文,基于 arXiv
2411.04872v7LaTeX source 生成。
原文:Elliot Glazer, Ege Erdil, Tamay Besiroglu, Diego Chicharro, Evan Chen, Alex Gunning, Caroline Falkman Olsson, Jean-Stanislas Denain, Anson Ho, Emily de Oliveira Santos, Olli Jarviniemi, Matthew Barnett, Robert Sandler, Matej Vrzala, Jaime Sevilla, Qiuyu Ren, Elizabeth Pratt, Lionel Levine, Grant Barkley, Natalie Stewart, Bogdan Grechuk, Tetiana Grechuk, Shreepranav Varma Enugandla, Mark Wildon 等。
作者与组织:核心团队来自 Epoch AI;贡献数学家来自 King's College London、MIT、University of Siegen、ICMC/USP、UC Berkeley、Cornell、Harvard、University of Leicester、University of Bristol、Rutgers、ETH Zurich 等机构。
本文保留 benchmark、pass@1、pass@8、MSC2020、SymPy、Lean、mathlib 等关键英文术语。
摘要¶
本文介绍 FrontierMath:一个由专家数学家设计并审核的 benchmark,包含数百道原创且极具挑战性的数学问题。题目覆盖现代数学的大多数主要分支,从数论、实分析中计算密集型问题,到代数几何、范畴论中的抽象问题。典型题目需要相关领域研究者投入数小时解决,最高难度题目则可能需要数天。
FrontierMath 使用新的、未公开发表的问题,并采用自动验证机制,以可靠评估模型,同时尽量降低数据污染风险。当前最先进 AI 模型在该 benchmark 上只能解决不到 2% 的题目,显示出 AI 能力与数学共同体能力之间仍存在巨大差距。随着 AI 系统逐步接近专家级数学能力,FrontierMath 提供了一个严格的测试平台,用来量化这种进展。
1. 引言¶
近年的 AI 系统已经在一些高难数学任务上表现突出,例如在几何题中达到奥赛级表现,或在组合数学中改进已有研究结果。但现有数学 benchmark 仍有两个核心问题。
第一,现有 benchmark 正在饱和。MATH、GSM8K 等标准数学 benchmark 主要评估高中到本科早期水平的能力。当前 SOTA 模型在这些 benchmark 上接近满分,因此它们已经难以区分模型在高级数学领域中的真实能力。若要判断 AI 是否能帮助数学研究,需要更接近职业数学家日常挑战的评测。
第二,训练数据污染会扭曲评测。LLM 训练集中可能无意包含 benchmark 题目,从而使模型成绩虚高。IMO、AIME 这类竞赛能提供较新的题目,污染风险较低,但题量小,且通常需要人工批改。
论文给出的第一个重要图表是在五个数学 benchmark 上比较“尚未被顶尖模型解决的问题比例”。它的读法是:纵轴越高,代表 benchmark 越没有饱和;FrontierMath 仍有超过 98% 的题目未被解决,而其他 benchmark 明显更接近饱和。这个图支撑了论文最核心的定位:FrontierMath 不是为了继续区分高中/竞赛数学能力,而是为了把评测难度推到研究级数学附近。

FrontierMath 通过三点回应上述限制:
- 题目全部为原创、未公开题,降低数据污染风险。
- 题目要求深层理论理解、创造性 insight 和专门领域知识。
- 题目答案可以自动验证,从而使闭源 frontier model 也能被高效、可复现地评估。
论文还采访了 Terence Tao、Timothy Gowers、Richard Borcherds 三位 Fields Medal 得主以及 IMO 教练 Evan Chen。他们一致认为这些题极其困难,需要深厚领域知识和显著时间投入。不过他们也指出,FrontierMath 的“数值答案”格式和真实数学研究中的原创证明并不完全相同。
2. 数据收集¶
2.1 题目收集流程¶
FrontierMath 由 60 多位来自十多个国家大学的数学家共同构建。贡献者覆盖研究生到 faculty,很多人有顶级数学竞赛背景,合计持有 14 枚 IMO 金牌;其中一位贡献者拥有 Fields Medal。
贡献者的领域覆盖代数几何、数论、点集拓扑、代数拓扑、组合数学、范畴论、表示论、偏微分方程、概率论、微分几何、逻辑、理论计算机科学等。由于许多贡献者本身是活跃研究者,题目自然包含当代数学研究中的高级技巧和 insight。
论文要求每道题满足四个条件:
- 原创性:题目可以建立在已有数学思想上,但必须以非显然方式改造,或创新组合多个思想,不能让模型靠模式匹配解决。
- 自动可验证性:题目必须有明确、可计算的答案。答案可以是整数,也可以是任意可由
SymPy表示的对象,例如符号表达式、矩阵、集合等。 - 防猜测性(guessproofness):不应存在大于 1% 的概率让人不做主要数学工作就猜中答案。许多题使用很大且不显然的数值答案来降低猜测可能性。
- 计算可处理性:如果题目需要大量计算,解法必须提供脚本,且脚本只能依赖该领域标准知识,并能在标准硬件上一分钟内运行完。
每道题提交时还需要包含详细解答、自动验证脚本和元数据。元数据包括数学主题、所需技术、难度评级等。随后,至少一名具备相关领域知识的数学家会进行 blind peer review,检查题面、解答、验证代码、难度和分类标签。题目还会经过原创性与污染风险检查。
2.2 自动验证¶
FrontierMath 只收录可以自动验证答案的问题。被评测模型需要提交一段 Python 代码,计算答案并把答案保存为 Python object。验证脚本再自动检查答案。
如果答案是唯一整数,验证脚本做精确匹配。如果答案是唯一的符号实数,验证脚本使用 SymPy 检查提交答案与标准答案的差是否化简为 0。其他情况需要 custom verification script。
下图用 Pell 方程示例说明自动验证:左侧是模型生成并保存答案的代码,右侧是验证脚本。这个例子需要自定义验证,因为方程有无穷多个解,不能只做唯一答案匹配。图的意义在于说明 FrontierMath 的评测对象不是“写出完整证明”,而是“提交一个可程序验证的数学对象”。

这种设计使评测不依赖 Lean 或 Coq 这样的形式化证明语言,也不需要人工逐题批改。它降低了评测成本,并减少人工评分不一致问题。
但这也带来限制:FrontierMath 无法收录必须评估证明文本正确性和清晰度的问题。论文承认,理论上可以要求模型提交 Lean 证明,但这会带来两点问题:当前模型通常没有充分训练来写形式化证明;而 Lean 的 mathlib 覆盖面也不足以覆盖研究级数学的广度。因此,FrontierMath 选择以自动可验证答案换取可扩展评测。
2.3 验证与质量保证¶
所有题目至少经过一次 blind peer review。reviewer 需要检查:
- 题面和解答是否正确。
- 题面是否存在歧义。
- 题目是否满足防猜测要求。
- 难度评级和元数据是否合适。
对有唯一解的题目,reviewer 需要检查数学论证、计算过程和脚本。对非唯一解题目,例如求某个丢番图方程的一组解,reviewer 主要检查验证脚本是否与题目要求一致,并用作者给出的答案测试脚本。
论文还额外抽取 30 道题做第二轮 blind review,并抽取 5 道题作为公开样例。35 道经过额外审查的 accepted problems 中,有 2 道存在作者给出的答案错误且第一轮 review 没发现。论文用 Jeffreys prior 估计 benchmark 的关键错误率,认为约 10% 是合理估计。这个数字的意义不是说 benchmark 不可靠,而是提醒读者:即便经过数学家审核,高难数学 benchmark 仍可能存在非零错误率。
第二轮 review 还发现 35 道题中有 6 道存在缺少假设的问题,2 道可通过比预期更少的努力猜到答案。论文因此计划从 passive review 转向更 active 的 review:不只是让 reviewer 看完整解答后批准,而是要求 reviewer 对题目的 soundness 给出更具体确认。例如对可直接验证的答案,直接测试条件;对符号实数或可计算值,用启发式近似结果作为强证据;对更抽象问题,则可能要求 reviewer 只根据关键思路自行解题。
2.4 原创性与数据污染防控¶
贡献者被明确要求创作新题。题目可以借用已有数学思想,但必须通过非显然改造或多思想组合,使解题不能退化为识别旧题。
为了避免题目和解答在线泄露,团队鼓励通过安全加密渠道提交,并要求在线存储材料加密。论文也承认,部分问题沟通中使用了普通 email。
原创性检查主要依赖核心数学团队的专家审查。他们会手动比对竞赛题库、数学网站、在线仓库和论文。团队还使用 Quetext 和 Copyscape 检查题面,结果没有发现重要匹配;少量提示来自标准数学术语或工具过敏感。团队没有检查解答文本,以减少解答暴露给在线系统的风险,并且选择这两个工具而不是 Turnitin,是因为它们把题目保存进未来训练数据库的风险更低。
2.5 难度评级¶
每道题从三个维度评级:
| 维度 | 含义 |
|---|---|
| Background | 1 到 5。1 表示高中水平,2 表示本科早期,3 表示本科后期,4 表示研究生水平,5 表示研究水平。 |
| Creativity | 专家找到关键解题 idea 预计需要的小时数,无上限。 |
| Execution | 找到关键 idea 后,完成计算、写脚本和严谨执行预计需要的小时数,无上限。 |
论文强调,数学题难度本身很难准确估计。看似不可能的题在掌握某个技巧后可能变得简单,同一题也可能存在多个复杂度不同的解法。模型也可能发现意外 shortcut。因此,这些难度分数只应被看作粗略指导。论文提到未发表初步工作显示,难度评级较高的问题被 GPT-4o 解出的概率更低,这为评级系统提供了一些支持,但还不足以构成强结论。
3. 数据集构成¶
FrontierMath 覆盖现代数学的广泛领域,包括基础领域和专门研究方向。论文称,在排除 MSC2020 中“00 General and overarching topics; collections”“01 History and biography”“97 Mathematics education”等不合适类别后,FrontierMath 覆盖了约 70% 的顶层 MSC2020 学科。
下表是 MSC2020 标签的比例分布。读表时注意:这里统计的是 MSC assignment 的比例,不一定等于题目比例,因为一道题可以有多个标签。数论和组合数学占比最高,合计约 34%。这既反映贡献者专长,也反映这些领域更容易构造可自动验证的数值答案。
| MSC 分类 | 比例 | MSC 分类 | 比例 |
|---|---|---|---|
| 11 Number theory | 17.8% | 57 Manifolds and cell complexes | 2.1% |
| 05 Combinatorics | 15.8% | 13 Commutative algebra | 2.1% |
| 20 Group theory and generalizations | 8.9% | 54 General topology | 1.4% |
| 60 Probability theory and stochastic processes | 5.1% | 35 Partial differential equations | 1.4% |
| 15 Linear and multilinear algebra; matrix theory | 4.8% | 53 Differential geometry | 1.4% |
| 14 Algebraic geometry | 4.8% | 42 Harmonic analysis on Euclidean spaces | 1.4% |
| 33 Special functions | 4.8% | 41 Approximations and expansions | 1.4% |
| 55 Algebraic topology | 3.1% | 52 Convex and discrete geometry | 1.4% |
| 12 Field theory and polynomials | 2.4% | 82 Statistical mechanics, structure of matter | 1.0% |
| 30 Functions of a complex variable | 2.4% | 44 Integral transforms, operational calculus | 1.0% |
| 68 Computer science | 2.4% | 17 Nonassociative rings and algebras | 1.0% |
| 18 Category theory; homological algebra | 2.4% | Other, each fewer than 3 problems | 9.9% |
下面的网络图展示学科如何在同一道题中组合。节点大小表示该主题出现频率,连边表示两个主题被同一道题共同使用。图要说明的是:FrontierMath 不只是把不同领域题目拼在一起,而是很多题需要跨领域技巧。论文指出,数论和组合数学共同出现最频繁,占 13% 的题;组合数学和群论共同出现占 9%;数论和群论共同出现占 8%。数论、组合数学、群论构成 benchmark 的核心,每个都与十多个其他数学领域组合。

论文还统计了所需技术。整个数据集涉及 200 多种不同技术。生成函数、递推关系、特殊函数较常见,但各自都出现在不到 5% 的题中;最常共同出现的技术组合也最多只在 3 道题中出现。这说明题目不是固定套路集合,而是高度分散的技术组合。
4. 评测框架与结果¶
4.1 支持实验的评测框架¶
FrontierMath 允许模型通过代码实验探索解法,模拟数学家解决难题时“提出猜想、计算验证、修正思路”的过程。模型可以分析题目、提出策略、写 Python 代码、读取执行输出和错误信息,再继续修正。
下图展示这一交互循环。读图时可以把它理解为“模型不是一次性写答案”,而是可以在 Python 环境中试探中间结论;但最终答案必须按规定格式提交。这个图支撑了论文对评测公平性的一个关键设计:高级数学题经常需要计算实验,因此给模型代码执行能力比纯文本作答更接近真实工作流。

最终答案提交必须满足标准格式:代码中包含精确注释 # This is the final answer,并用 Python pickle 把答案保存到 final_answer.p。提交代码必须自包含,不能依赖前面交互中的状态。实验中 token limit 设为 10,000;如果模型到达上限仍未提交答案,会收到最终提示,要求立即给出最终答案。若仍无法按格式提交,该次尝试记为错误。
4.2 FrontierMath 准确率¶
论文评测了六个领先模型:
- o1-preview
- o1-mini
- GPT-4o, 2024-08-06
- Claude 3.5 Sonnet, 2024-10-22
- Grok 2 Beta
- Gemini 1.5 Pro 002
所有模型表现都很低,在完整 benchmark 上没有任何模型达到 2% 成功率。这与 GSM8K、MATH、AIME 2024、Omni-MATH 等更接近饱和的评测形成鲜明对比。
下图展示 8 次运行平均准确率。读图重点不是比较模型排名,而是看绝对量级:最好的模型平均每次也解决不到 2% 的题。论文特别提醒,由于成功率极低且完整 benchmark 只运行一次,模型之间的细微排序不能过度解读,单个成功样本会对排名产生过大影响。

为了理解“被至少一个模型解出过”的题目,作者找出任何模型至少解出过一次的 4 道题,并对每个模型在每道题上重复运行 5 次。结果显示 run-to-run variance 很高:只有一个 case 中模型 5 次全解对,即 o1-preview 在第 2 题上 100%。这说明某次解对不一定代表稳定能力。
论文还指出,即使模型得到正确答案,也不一定代表推理正确。有一道题中,简单模拟就足以做出较准确猜测,不需要深层数学理解。但整体准确率极低说明这种猜测策略并不适用于绝大多数 FrontierMath 题。
4.3 响应次数与 token 使用¶
不同模型使用实验环境的方式差异很大。o1-preview 平均每题只有 1.29 次响应,而 Grok 2 Beta 平均 3.81 次。o1-preview 和 Gemini 1.5 Pro 002 通常在看到任何实验结果前就提交最终答案,尽管 prompt 明确允许它们花时间实验并等到更有把握再猜。其他模型则有更长交互。
token 使用也体现出差异。Gemini 1.5 Pro 002 只有 16.8% 的题达到 10,000 token limit;Claude 3.5 Sonnet、GPT-4o、Grok 2 Beta 超过 45% 的尝试会达到上限。Gemini 1.5 Pro 平均每题约 6,000 token,其他模型平均在 12,000 到 17,000 token。平均值可能超过 10,000,是因为到达上限的模型仍会看到最后一次实验结果并完成最终答案。
5. 相关工作¶
数学推理评测已经形成多条线索。
GSM8K 和 MATH 主要覆盖基础数学推理,从小学/中学到本科早期。它们曾经有用,但随着 SOTA 模型接近满分,区分能力下降。
更难的 benchmark 包括 ARB、GHOSTS、OlympiadBench、PutnamBench、OmniMATH 等。它们覆盖大学、研究生或奥赛级题目,但很多依赖历史竞赛材料,因此有训练数据污染风险。
Putnam-AXIOM 通过程序化修改 Putnam 题目来降低污染,例如重命名变量、改变常数。论文提到,o1-preview 在原始 Putnam 题上的准确率为 50%,在生成变体上降至 34%。但这种方法只提供有限新颖性,也不能显著提高题目难度。
AIMO 致力于发展达到 IMO 金牌水平的 AI 系统,使用新创作的国家奥赛级题目来降低污染风险。但它要求运行模型是 open-weight,因此无法正式评测闭源 frontier model。
形式化数学 benchmark 例如 MiniF2F 提供 Lean、Isabelle、Metamath 等系统中的形式化题目,适合评估 neural theorem prover。但它同样面临污染问题,且主要关注竞赛式问题,不是研究数学。
FrontierMath 的差异有三点:
- 完全使用新的未公开问题,降低污染。
- 难度推进到研究级数学,超出基础题和竞赛题。
- 自动验证系统允许高效、可复现地评测闭源 frontier AI 系统。
6. 数学家访谈¶
论文访谈了 Terence Tao、Timothy Gowers、Richard Borcherds 和 Evan Chen。Evan Chen 也是论文作者之一,Terence Tao 也为 benchmark 贡献了若干题。
6.1 对难度的判断¶
四位受访者都认为 FrontierMath 中研究级问题极其困难,最难题需要深厚领域专长和大量时间。Tao 在看过若干题后认为,短期内解决这些题基本需要真正的领域专家,或相关领域研究生与现代 AI、代数软件等工具协作。
但受访者也指出,数值答案格式有些人为。Borcherds 特别提到,这些 benchmark 问题“不完全等同于提出原创证明”。
6.2 对 AI 进展时间线的判断¶
受访者对 AI 何时能解决 FrontierMath 级问题有很大不确定性,但一致认为当前 AI 远远不够。Tao 预计该 benchmark 至少会在数年内抵抗 AI,因为问题需要大量领域专长,而相关训练数据非常有限。
访谈中也出现一个重要判断:人机协作可能先于完全自动化。Chen 和 Tao 都认为,在约三年内,人类专家与 AI 系统协作可能解决 FrontierMath 问题,早于全自动系统。Tao 表示,在高级研究生水平问题上,指导当前 AI 找到正确解大约需要直接解题 5 倍的努力;但随着工具和能力改善,这个比例可能在数年内对某些问题降到 1 以下。
6.3 主要障碍¶
最大障碍是训练数据极其有限。Tao 指出,许多 FrontierMath 问题相关训练数据“几乎不存在”,可能只有十几篇相关论文。Gowers 强调,解这些题需要熟悉某个数学分支的“tricks of the trade”,这种领域知识很难在缺少大量训练数据时获得。受访者讨论了 synthetic data 和 formal verification 等可能方向。
6.4 FrontierMath 级系统的用途¶
如果 AI 能解决 FrontierMath 级问题,它最可能先成为数学研究助手,而不是替代数学家。Gowers 认为,这类系统可以处理研究中稍显枯燥但费时的部分,例如检查某个有用猜想是否为真。Tao 也强调其价值在于例行但技术要求高的计算,可能帮助数学家处理原本需要数周的工作。
但受访者提醒,实际价值取决于计算成本。Tao 用 AlphaProof 一类系统举例:如果工具每解一道题需要消耗整个 Google 级别计算资源三天,那作为日常研究工具的价值会受限。
7. 讨论¶
FrontierMath 是一个覆盖现代数学多数分支的高难数学问题 benchmark。它特别关注研究级问题,题目通常需要专家数学家投入数小时集中工作。实验显示,领先 AI 模型无法解决超过 2% 的题目。论文还通过向四位专家数学家展示样例题,对难度做了定性验证。
与 MATH、GSM8K 等 benchmark 相比,FrontierMath 解决两类问题:
- 难度更高,强调深度推理和创造性,当前模型不会轻易饱和。
- 题目原创且未公开,降低训练数据污染风险。
但 FrontierMath 也有明确局限:
- 自动可验证和数值答案设计排除了证明写作和开放探索,而它们是现代数学研究的重要部分。
- 虽然题目比现有 benchmark 难得多,但仍不是完整数学研究。真实研究可能持续数周、数月甚至数年;FrontierMath 为了可评测性把任务限制在数小时到数天。
- 当前模型解题率太低,短期内限制了它区分模型相对能力的作用。论文预计随着 AI 改进,这个限制会逐渐缓解。
论文认为,数学能力评测不仅能衡量模型是否能帮助数学研究,也能作为更广义科学推理能力的 proxy。FrontierMath 通过高难度和严格验证,提供了跟踪高级推理能力进展的系统方式。
8. 未来工作¶
作者计划继续扩展 FrontierMath,加入新的、经过严格审核的问题,并改进质量保证流程,以减少答案错误、提高难度评级可靠性。团队还计划发布更多代表性样例题。
评测方法上,作者计划测试更高 token limit,让模型有更长推理和更多实验机会;也计划对每个 model-problem pair 运行多次,以报告统计量和置信区间。
Epoch AI 表示会把 FrontierMath 作为公共资源维护,定期评测领先模型,并继续与数学家合作生产新题、做质量保证、验证难度分数,并提供透明的数学推理能力评估。
附录 A:样例题与解法思路¶
论文公开了五道样例题,每个难度 quintile 随机选一道,从研究级数论到本科代数几何。这里保留题面、答案和主要解法链条;完整英文推导见 main_en.md 与 source LaTeX。
样例题 1:高难度,Artin primitive root conjecture 相关¶
题目定义正整数 $n$ 的 $v_p(n)$ 为满足 $p^v \mid n$ 的最大整数。对素数 $p$ 和 $a \not\equiv 0 \pmod p$,令 $\ord_p(a)$ 为最小正整数 $o$,使得 $a^o \equiv 1 \pmod p$。题目构造 $\ord_{p,x}(a)$,定义满足 $\ord_{p,x}(2) > \ord_{p,x}(3)$ 的素数集合 $S_x$,令 $d_x$ 为其在素数中的密度,并要求计算 $\lfloor 10^6 d_\infty \rfloor$。
答案是 367707。
解法核心来自 Artin primitive root conjecture。直观上,题目想问满足 $\ord_p(2) > \ord_p(3)$ 的素数密度。Artin 猜想关注哪些整数 $a$ 会在无穷多个素数模 $p$ 下成为 primitive root,即 $\ord_p(a)=p-1$。相关密度计算通常依赖 Chebotarev density theorem 和 GRH 条件下的误差控制。论文样例通过引入 $x$ 参数,把误差项处理成有限项,使问题聚焦于主项计算。
解法需要对密度 $d(a,b,x)$ 建立显式但繁琐的公式,再通过 inclusion-exclusion 计算 $\ord_{p,x}(2)$ 和 $\ord_{p,x}(3)$ 的相对大小。难点在于:这不是套用文献中已计算好的密度,而是要理解 Artin 猜想推广中的主项结构,并做大量有限但复杂的枚举与验证。
样例题 2:中高难度,19 次多项式与单值化/monodromy¶
题目要求构造一个 $p(x)\in\mathbb C[x]$ 的 19 次多项式,使
$$ X:={p(x)=p(y)}\subset \mathbb P^1\times\mathbb P^1 $$
在 $\mathbb C$ 上至少有 3 个不可约分支,但不是全部线性分支。要求 $p(x)$ 为奇函数、首一、实系数、一次项系数为 -19,并计算 $p(19)$。
答案是:
解法把 $p:\mathbb P^1_x\to\mathbb P^1_z$ 看作 19 次 covering,并研究 fibre product $X$ 的 monodromy。不可约分支对应 monodromy group 在 $S_{19}^2$ 上的 orbit。Burnside 定理与 Sylow 定理约束了置换群结构,Riemann-Hurwitz 进一步限制 branch cycle。最终唯一可能是与 19 次 Chebyshev polynomial $T_{19}$ 仿射等价的多项式。再利用奇函数、首一、一次项系数等条件,得到
$$ p(x)=2T_{19}(x/2), $$
从而计算出 $p(19)$。
样例题 3:中等难度,递推序列与 $p$-adic 连续延拓¶
题目给定整数序列 $a_n$,满足一个四阶线性递推和初始条件 $a_i=i, 0\le i\le 3$。要求找出最小素数 $p\equiv 4\pmod 7$,使 $n\mapsto a_n$ 可以连续延拓到 $\mathbb Z_p$。
答案是 9811。
解法思路来自 Skolem-Mahler-Lech theorem。把递推写成特征多项式根 $\alpha_i$ 的线性组合:
$$ a_n=c_1\alpha_1^n+c_2\alpha_2^n+c_3\alpha_3^n+c_4\alpha_4^n. $$
若所有根满足 $v_L(\alpha_i-1)>0$,则可用 $p$-adic exponential/logarithm 把 $\alpha_i^n$ 延拓到 $\mathbb Z_p$。由常数项和一次对称和可推出候选素数必须同时整除相关整数,筛选后只有 $9811$ 满足条件。对 $p=9811$,特征多项式模 $p$ 化为 $(x-1)^4$,因此根都同余于 1,连续延拓成立。
样例题 4:中低难度,矩阵四元组与 $S_5$ 表示¶
题目考虑四元组可逆 $1000\times1000$ 复矩阵 $(A_1,A_2,A_3,A_4)$,满足一组 Coxeter 型关系,并在 $GL(1000)$ 共轭作用下求 orbit 数。
答案是:
解法把这些关系识别为对称群 $S_5$ 的 Coxeter relations。因此矩阵四元组等价于 $S_5$ 在 1000 维复向量空间上的表示,而 $GL(1000)$ 共轭只是在换基。问题转化为:1000 维 $S_5$ 表示按同构分类有多少种。
$S_5$ 的不可约表示维度为:
$$ 1,1,4,4,5,5,6. $$
因此要数把 1000 写成这些维度非负整数线性组合的方案数。对应生成函数为:
$$ \frac{1}{(1-t)^2(1-t^4)^2(1-t^5)^2(1-t^6)}. $$
$t^{1000}$ 的系数即为答案。
样例题 5:低难度,有限域上射影曲线点数¶
题目要求计算曲线
$$ x^3y+y^3z+z^3x=0 $$
在 $\mathbb F_{5^{18}}$ 上非零点按 scaling 等价后的个数。
答案是:
解法先用代码数出 $\mathbb F_5,\mathbb F_{25},\mathbb F_{125}$ 上的点数分别为 6、26、126,由此识别模式。论文给出一个 projective solution counter,用于在小有限域上计数并找规律。这个图的读法是:代码不是最终证明本身,而是帮助发现 Frobenius 特征值模式的实验工具;它体现了 FrontierMath 允许并鼓励模型用代码实验。
论文随后验证该曲线在 $p=5$ 处光滑且 genus 为 3。由 Weil conjectures,有
$$ |C[\mathbb F_{p^n}]|=p^n-\sum_{i=1}^{2g}\alpha_i^n+1, $$
其中 $\alpha_i$ 成共轭对且绝对值为 $\sqrt p$。代入 $n=18$ 得到:
$$ |C[\mathbb F_{5^{18}}]|=5^{18}+6\cdot5^9+1. $$
附录 B:Prompt 与重复评测¶
B.1 Prompt 设计¶
初始 prompt 会把题目交给模型,并说明模型可以提交三反引号包裹的 Python 代码运行实验。最终答案必须包含精确注释 # This is the final answer,并把答案 pickle 到 final_answer.p。prompt 还提醒模型:不要假设自己能可靠心算复杂算术和代数,应使用 Python 验证推理。
每轮交互后,如果模型还没有正确提交答案,系统会把代码执行结果、错误信息、标准输出或 timeout 告诉模型,并鼓励它继续尝试新方法。
如果模型达到 token limit 仍未提交正确答案,最终 prompt 会要求它立刻提交最佳尝试。对作者预期解法运行超过 20 秒的问题,相关限制被移除。
B.2 至少被解出一次的题目¶
论文选择 4 道至少被一个模型解出过的题,并对每个模型每道题重复运行 5 次。下表展示 5 次中的成功率。读表重点是稳定性:同一道题上,不同模型和同一模型不同 run 的表现差异很大。
| Problem | Grok 2 Beta | o1-preview | o1-mini | GPT-4 | Gemini 1.5 Pro | Claude 3.5 Sonnet | MSC2020 分类 |
|---|---|---|---|---|---|---|---|
| 1 | 60% | 40% | 20% | 0% | 0% | 20% | 60 Probability theory; 41 Approximations and expansions |
| 2 | 0% | 100% | 20% | 20% | 0% | 80% | 55 Algebraic topology; 57 Manifolds and cell complexes |
| 3 | 0% | 80% | 0% | 0% | 60% | 0% | 20 Group theory; 12 Field theory |
| 4 | 0% | 0% | 20% | 0% | 0% | 0% | 14 Algebraic geometry; 05 Combinatorics |
B.3 未解决比例与 pass@8¶
论文的未解决比例图使用 1 - pass@1 top reported accuracy 计算。MMLU College Mathematics、GSM8K、MATH、AIME、Omni-MATH、MathVista 的数据来自相应论文或榜单;FrontierMath 使用作者自己的评测,显示超过 98% 的问题仍未被最佳模型解决。
pass@8 图展示 8 次尝试中至少一次成功的比例。读图时应把它与平均准确率图区分:平均准确率低于 2%,但 pass@8 中 o1-preview 约为 6%,Grok 2 Beta 约为 2%。这说明重复采样能提高“至少一次解对”的概率,但绝对水平仍很低。

附录 C:元数据字段¶
| 元数据字段 | 描述 |
|---|---|
| Background rating | 1 到 5 的背景知识难度。1 为高中,2 为本科早期,3 为本科后期,4 为研究生,5 为研究级。 |
| Creativity rating | 具备所需背景的人类专家找到关键 idea 预计需要多长时间。 |
| Execution rating | 完成技术细节、精确推理和计算所需的注意力与执行工作量。 |
| Subjects | 题目所属的宽泛数学主题,例如 analytic number theory、representation theory、differential geometry 等。一题可有多个主题。 |
| Techniques | 解题可能用到的技术、定理、结果等,不要求穷尽,只记录作者认为最突出的项目,例如 generating functions、double counting、Vieta's theorem。 |
| Is programming required? | 人类专家是否需要编程环境才能找到答案,取值为 yes 或 no。 |