OpenAI 一口气放出 722 篇数学论文,几百个悬而未决的问题被解决了

小李爱学习 初级 50分钟前 448 浏览 4 点赞 约 4 分钟

数学圈这半个月不太平静。OpenAI 手里那个还没发布的 frontier 模型,一下子解掉了 "hundreds" 个长期悬而未决的数学问题,相关成果整理成 722 篇手稿一次性放了出来,按主题归成 372 个 result families。这批东西不是预印本网站上那种零散投稿,是成体系的一整批,而且背后有个叫 AGMAI 的独立顾问团在帮忙把关怎么对外沟通。
先说清楚这批东西的分量。数学界真正难的开放问题,往往几十年都没人动得了。这次 OpenAI 的模型不是做那种"证明某个猜想在特定条件下成立"的边角料,而是直接啃硬骨头。AGMAI 这个组织是刚成立的,成员都是精英数学家,专门负责把模型产出的结果用数学家能看懂、能验证的方式传播出去。他们确认这次放出的内容里包含对 "hundreds" 个开放问题的解答——注意这个用词,是解答,不是猜测。
这批成果其实已经传了好几周了。OpenAI 内部有个不成文的规矩,重大成果会先让一小部分人知道,然后慢慢往外漏。这次数学突破的消息最早是从几个数学家的社交媒体上漏出来的,当时大家还在猜是什么级别的成果,现在 722 篇手稿落地,规模比预想的大得多。
真正有意思的不是模型多能打,而是数学界对这件事的反应很分裂。一部分人觉得这是工具革命,以后数学家可以拿模型当计算器用,把精力放在提问题和解释结果上;另一部分人担心的是学术伦理问题——模型证明出来的东西,到底算谁的成果?论文署名怎么写?审稿人怎么验证一个可能长达几百页的机器证明?
这个问题其实已经摆在桌面上了。以前也有过计算机辅助证明的先例,比如四色定理,但那是人写程序、程序辅助人。这次不一样,是模型自主发现证明路径,人能做的只是事后验证。验证本身也是个难题,数学证明的验证不像代码测试,跑一遍就知道对不对,你要逐行检查逻辑,而模型给出的证明往往不是人类习惯的那种思路,可能是非常绕、非常反直觉的路径。
AGMAI 这个独立顾问团的角色就是干这个的。他们不是 OpenAI 的员工,是独立的数学家群体,负责把模型产出的结果翻译成数学界能接受的语言,然后组织同行评审。这个模式如果跑通了,可能会成为以后 AI 科研的标准流程——公司出模型和算力,独立学术组织出信誉和评审能力,两边各管一段。
我比较关注的是这批成果里有没有那种"反直觉的证明"。数学里很多开放问题,人类之所以解不开,不是因为不够聪明,而是因为思路被限制在某个框架里。模型没有这个包袱,它可能从完全不同的方向切入,给出的证明路径人类根本想不到。这种证明一旦被验证,对数学家的思维方式本身就是一种冲击——原来还能这么想问题。
不过也有个现实问题,就是模型会不会出错。数学证明这东西,错一步就全盘皆输。722 篇手稿,如果里面混了几个错的,而且错得很隐蔽,那对 OpenAI 的公信力是个打击。AGMAI 说他们在负责验证,但验证 722 篇的工作量不是开玩笑的,短期内可能只能抽检或者靠数学社区自己消化。
还有个细节值得注意,这批成果来自一个 unreleased 的模型。也就是说,这个模型比现在市面上能用的所有 OpenAI 模型都强,但还没正式发布。OpenAI 拿它来解数学题,可能是在测试模型的推理能力上限。数学推理被认为是 LLM 最难突破的领域之一,因为它的正确性是可判定的,对就是对、错就是错,没法糊弄。如果这个模型真能稳定地产出正确的数学证明,那它在其他领域的推理能力大概率也不弱。
对普通开发者来说,这批论文的意义不在于你能不能看懂证明,而在于一个信号——模型的推理能力已经进入了一个新阶段。以后写代码、做规划、分析数据这些任务,模型的可靠性可能会上一个台阶。数学证明是最严格的测试场,能过这一关的模型,处理日常任务出错的概率会低很多。
现在的问题是,OpenAI 什么时候把这个模型放出来。按他们以往的节奏,论文先发、模型后上,中间可能隔几个月。而且 722 篇手稿只是这批成果的载体,里面具体哪些问题被解决了、哪些证明最有价值,还需要数学社区慢慢消化。我打算过阵子去翻翻,看看有没有那种"一句话证明"级别的惊艳结果——模型在简洁性上能不能也超过人类。

OpenAI 一口气放出 722 篇数学论文,几百个悬而未决的问题被解决了
openai求助数学证明AGMAI前沿模型

全部回复 (1)

想当场把话说完?进全球 AI 聊天室,登录就能开口。

独
独立开发者Leo 专家 49分钟前

心疼这 722 篇手稿,AGMAI 确认有 "hundreds" 个问题被解了,但没提具体是哪 372 个 result families 中哪个问题被哪篇手稿解决了,光有数量没细节啊。

0 回复

发表回复

支持 Markdown 格式