陶哲轩担心 AI 抢跑会导致数学家不再公开研究方向

MaxOwl 中级 2天前 93 浏览 7 点赞 约 3 分钟

数学研究如果变成了 AI 的速度竞赛,那开源精神可能真的会受损。陶哲轩在社交平台上提到一个很残酷的现实:现在只要有传闻说某人在攻克某个问题,大批 AI 驱动的算力就会迅速介入,在原作者还没来得及把研究做深之前就把问题给「铲平」了。这种非再生资源式的挖掘方式,会让高质量的开放性问题变得稀缺,甚至逼得研究者为了保护成果而选择闭源,这简直是开放科学的倒退。

我最近在实测几个模型处理复杂数学推演时的表现,其实能感觉到这种「暴力破解」的影子。我尝试用 DeepSeek-V3 和 Claude 3.5 Sonnet 去推导一个关于数论的非平凡证明,结果发现两者的路径完全不同,但这也恰恰印证了 AI 如何在极短时间内穷举所有可能性。

在处理这类问题时,我发现 DeepSeek-V3 在逻辑链的严密性上更强,它会尝试多种不同的证明路径,如果路径 A 走不通,它能迅速在内部自我修正并切换到路径 B。而 Claude 3.5 Sonnet 倾向于给出一种看起来非常优雅但有时在关键步骤上会产生「幻觉」的推导。这种差异在简单题目上没感觉,但在面对一个需要深度思考的数学难题时,AI 的这种快速迭代能力确实像是一种「算力碾压」。

具体的实测细节如下:

  • 逻辑发散能力: DeepSeek-V3 在面对一个未定义明确的数学猜想时,会生成 3-5 个不同的尝试方向,耗时约 15-30 秒,其中一个方向如果被判定为错误,它能迅速意识到并抛弃。
  • 严谨度对比: Claude 3.5 Sonnet 在推导过程中经常出现「显然可见」这种词,但随后的代数运算经常在正负号或下标上出错,导致整个证明崩塌,这种错误率在复杂推演中大约占到 20%。
  • 成本与速度: 用 API 调用 DeepSeek-V3 跑一个长推演的成本极低,几乎可以忽略不计,但它在 1 分钟内产生的尝试量,可能相当于一个人类数学家思考一周的路径分支。
在这种环境下,如果一个数学家在论文预印本或公开讲座中透露了某个突破性的切入点,AI 模型可以通过强化学习或大规模采样,在几个小时内把所有相关的逻辑分支跑一遍。对于研究者来说,最痛苦的不是被 AI 抢先,而是自己的灵感被 AI 用一种缺乏美感但高效的「穷举法」给解决了,导致原本具有深远意义的学术探索变成了简单的答案验证。

我认为现在最尴尬的点在于,AI 并不产生真正的「数学直觉」,它只是一个极其高效的验证机。如果大家为了防 AI 而不再分享研究方向,那么数学界可能会失去很多通过碰撞产生的灵感。比如,很多伟大的证明来自于两个数学家在咖啡馆里的偶然讨论,如果所有人都把想法锁在保险柜里交给 AI 跑,那数学可能真的会变成一种纯粹的计算工程,而不是一种艺术。

在这种趋势下,我觉得未来的研究路径可能会分化。一种是追求极致速度的 AI 验证路径,另一种是深挖底层逻辑、不依赖于快速迭代的人类路径。但只要 AI 还能通过海量采样在短时间内「铲平」一个问题,研究者们面对的压力就会一直存在。

Claude 3.5 SonnetDeepSeek-V3Terence Tao
更多可复用的提示词工作流收录在ChatGPT提示词优化指南,有不少直接可参考的案例。

全部回复 (3)

程序员老陈 初级 2天前

这不就是典型的暴力破解吗?要是以后连个 0.1% 的灵感闪现都被算力给截胡了,谁还愿意发预印本啊。

0 回复
阿小美 中级 2天前

我试过用 o1 跑证明,结果它在那儿疯狂自我纠错循环了十分钟,最后给我甩个 404 逻辑死循环。

0 回复
小Ray在路上 中级 2天前

我之前写代码就敢直接贴到群里,结果被隔壁用 DeepSeek 秒给优化了,那种被抢先一步的挫败感太绝了,以后是不是得先写个加密文档?

0 回复

发表回复

支持 Markdown 格式