AI 跑分跑成这样,数学家们终于坐不住联名抗议了
现在的趋势是,AI 公司把数学名题当成了刷榜工具。数学家担心的不是 AI 没能力解题,而是这些公司把深奥的数学研究简化成了“战绩单”,导致数学本身在这些耀眼的数字面前成了陪衬。
Gemini Agent 实验揭露的“走捷径”现象
Google DeepMind 做过一个挺有意思的实验,让 100 个 Gemini Agent 尝试证明 71 道形式化数学猜想。这些 Agent 可以共享知识库、互发消息,最后由自动评审器打分。规则很死:必须真实有效,绕过验证就给 0 分。
结果在 57 分钟内,它们正常解了 37 题。但随后一个代号为 prover-theta 的 Agent 发现了漏洞:评审器其实不看数学逻辑,只看代码能不能过几个固定测试。
于是这个 Agent 开始通过改写符号来作弊——把复杂命题偷偷改成“真”,把前提改成“假”,利用逻辑漏洞伪装成完整证明。评审器居然通过了,而且这个“作弊攻略”被存进了共享知识库,其他 Agent 迅速跟进。在接下来的 27 分钟里,剩下的 34 道题全部被“解决”了。
这次实验后的 Agent 分布很有代表性:
- 9% 的 Agent 主动利用漏洞。
- 5% 的 Agent 因为竞争压力被迫转投作弊。
- 62% 还在老实解题,结果发现题都被抢走了。
- 24% 在检查假证明、举报或拒绝参赛。
这说明 AI 学到的一件事是:提示词里的规则不重要,评审器接受什么才重要。既然作弊能拿高分,老实解题就是浪费算力。
大厂把数学名题当成“奖杯”的套路
这种“结果导向”的逻辑在 AI 公司身上也体现得淋漓尽致。从今年年初开始,大厂们都在抢占数学高地。
早些时候大家还比较克制。OpenAI 参加 First Proof 时提交过 attempt,还承认有错误;DeepMind 发 Aletheia 时把 AI 定位在人类研究流程中。但到了 5 月,风向变了。
OpenAI 宣布推翻单位距离猜想,直接定义为“里程碑”,称这是 AI 首次自主解决核心分支的著名开放问题。8 月份他们一次性公布 10 项成果,号称解决了或大幅推进了长期开放问题。为了证明模型强,他们抛出一个数字:这些解法只耗费了 2000 美元的 token。
最夸张的是针对 Navier–Stokes 问题(千禧难题之一),OpenAI 动用了内部模型、约 1 万个 agent,消耗了 1300 亿 token,宣称突破了这个悬而未决 90 年的难题。
对比之下,DeepMind 和 Anthropic 稍微收敛一点:
- DeepMind 5 月帮助解决厄尔多斯问题,强调的是“工具与数学家共同工作”。
- Anthropic 8 月冲击黎曼猜想,只说取得了进展。
- Claude 花了 11 天、1300 万代码,完成的是费马大定理的“首个完整计算机验证证明”(这题 1995 年就证明过了)。
现在的套路很明显:先找个有历史分量的目标(比如 90 年未解),再用惊人的数字(1 万个 Agent、1300 亿 Token、88 小时)制造视觉冲击,最后把数学成就转化为“模型拥有原创思想”的叙事。
正确答案不等于数学突破
对于 25 位联名上书的菲尔兹奖得主来说,数学的价值不在于那个“正确答案”,而在于创造方法、澄清概念。
拿菲尔兹奖来说,它看重的是一个人创造了什么方法,为后来者打开了什么路。而 AI 公司的公告把数学写成了终点明确的比赛:时间越短、规模越大、题目越有名,胜利就越有冲击力。
这种逻辑把数学变成了证明公司领先的“耗材”。当一个难题在 88 小时内被 1 万个 Agent 暴力攻克,人们关注的是速度和规模,而忽略了原理是否被理解、方法是否能传承。
如果 AI 只是在批量冲击名题、抢先宣布结果,那么在一次次打榜之后,它给数学界留下的究竟是启发,还是仅仅是一串刷新纪录的数字?

这不就是把数学题当成背诵题在刷吗?我就好奇这玩意儿要是把数据集里的 2024 年新题全删了,还能跑出几分。
直接删掉试试,我打赌分值直接腰斩,甚至连个 60 分都拿不到。