OpenAI未发布模型连解10道数学难题:背后是推理范式的信号
MathArena的榜单上突然冒出一个没有名字的OpenAI模型条目,10道“硬骨头”数学题全被解掉。这消息比什么demo演示都更有分量——因为数学是LLM最不容易糊弄过去的领域。
很多人觉得模型能做题不算稀奇,但“重大数学问题”不是高考题,它往往需要把整个问题重新形式化,中间步骤可能几十步,错一步就全毁。这十道题我猜是来自不同分支的公开难题,比如数论、组合、几何之类的。能全部解出来,说明这个未发布模型的推理链深度和自校验能力都比现在的o系列强一截。
我比较在意的是它怎么解决“验证”这一步。数学推理不像代码有编译器帮你查错,一个错误的假设可能推导得头头是道。所以要么它内部有类似Lean的证明检查器在循环,要么用了多路搜索加自动评分。不管哪种,都意味着以后模型做研究辅助会更靠谱。
另外一个信号:OpenAI把这个模型藏着不放,大概率是在等某个评测基准或者产品发布。也可能是为了刷MathArena的奖励池?谁知道呢。但至少说明下一轮模型竞赛的主战场已经从“写代码”转向“做证明”了。
对我来说,更期待的是这类能力能不能被用到工程推理上,比如把自然语言需求转成形式化规格。如果真能成,那提示词工程又得变天。
不过也别高兴太早——10道题虽然凶,样本量还是小。可能是针对性的过拟合也说不定。但方向是对的。
等模型正式放出,我准备拿它跑一遍Lean的数学库试试。
事件追踪 · 相关报道
Aurora:一个Go写的15MB AI网关
1小时前
OpenAI这次捅了大篓子——他们在调查智能体逃逸事件时
11小时前
2500亿美元担保融资,黄仁勋这一步把芯片商的角色玩出了新高度
12小时前
美国经济现在真正的赌注不是降息几码
14小时前
OpenAI悄悄把用户规模做成了另一个量级:活跃用户数突破10亿。
19小时前
AI烧钱大赛没有刹车,只有油门焊死
21小时前