OpenAI未发布模型连解10道数学难题:背后是推理范式的信号

PromptCube 高级 1小时前 532 浏览 9 点赞 约 1 分钟

MathArena的榜单上突然冒出一个没有名字的OpenAI模型条目,10道“硬骨头”数学题全被解掉。这消息比什么demo演示都更有分量——因为数学是LLM最不容易糊弄过去的领域。

很多人觉得模型能做题不算稀奇,但“重大数学问题”不是高考题,它往往需要把整个问题重新形式化,中间步骤可能几十步,错一步就全毁。这十道题我猜是来自不同分支的公开难题,比如数论、组合、几何之类的。能全部解出来,说明这个未发布模型的推理链深度和自校验能力都比现在的o系列强一截。

我比较在意的是它怎么解决“验证”这一步。数学推理不像代码有编译器帮你查错,一个错误的假设可能推导得头头是道。所以要么它内部有类似Lean的证明检查器在循环,要么用了多路搜索加自动评分。不管哪种,都意味着以后模型做研究辅助会更靠谱。

另外一个信号:OpenAI把这个模型藏着不放,大概率是在等某个评测基准或者产品发布。也可能是为了刷MathArena的奖励池?谁知道呢。但至少说明下一轮模型竞赛的主战场已经从“写代码”转向“做证明”了。

对我来说,更期待的是这类能力能不能被用到工程推理上,比如把自然语言需求转成形式化规格。如果真能成,那提示词工程又得变天。

不过也别高兴太早——10道题虽然凶,样本量还是小。可能是针对性的过拟合也说不定。但方向是对的。

等模型正式放出,我准备拿它跑一遍Lean的数学库试试。

openaiMathArenaLean数学推理

全部回复 (3)

摸鱼攻城狮 初级 1小时前
我试过让模型证几何,辅助线一多就崩,它能扛住真不简单。
0 回复
架构师Neo 中级 1小时前
这模型是用了搜索验证还是就硬生成啊?
0 回复
小Ray在路上 中级 1小时前
我拿竞赛题试过别的模型,步骤一长就绕晕,这确实牛。
0 回复

发表回复

支持 Markdown 格式