从嘲笑 GPT-5 算错小学算术到依赖它写代码,这一年发生了什么
回看一年前在 r/singularity 社区疯传的那个帖子《GPT-5 Can't Do Basic Math》,现在的感觉就像在看一场大型的“鞭尸现场”。当时那个帖子的配图极其简单:用户给模型出了一道三位数加减法的算术题,结果 AI 算出了一个离谱的十位误差。评论区当时几乎成了狂欢现场,满屏的“就这?”和“AGI 梦碎”,很多人以此为证据,断定大模型在逻辑推理上存在不可逾越的缺陷。
当时我也被这种“反差感”逗笑了。一个号称能处理海量数据的超级智能,竟然在小学一年级的数学题面前翻车,这种戏剧性让很多人觉得 AI 只是一个高级的概率预测机器,根本不具备真正的认知能力。
但现在回头看,这种评价逻辑其实非常诡异。人类对 AI 的容忍度低到离谱:一个模型可以帮你分析万字长文的学术论文,可以帮你 debug 复杂的异步请求代码,甚至能写出极具灵气的诗歌,但只要它在一次两位数乘法中算错了一位数,立刻就会被钉在“没用”的耻辱柱上。讽刺的是,我们在现实生活中算账时习惯性使用计算器,却没人说我们“丧失了基本数学能力”,但当 AI 出现这种低级错误时,人们倾向于将其定义为“底层能力的缺失”。
事实上,这一年里发生的变化是颠覆性的。虽然早期的模型在纯数学计算上确实存在短板,但开发者们并没有在原地打转,而是通过强化学习(RL)等路线,专门针对数学推理进行了深度优化。现在的模型在处理复杂推理、多模态理解和长上下文时的表现,已经让当初那些嘲笑者们闭了嘴。现在这批曾经的质疑者,已经悄悄把话题转向了“AI 什么时候能替我把整个项目代码写完”。
这种演进路径其实揭示了一个真相:AI 的能力提升并不是线性的,而是某种程度上的“阶梯式”跃迁。当你还在纠结它是否能算对 123 × 456 的时候,它可能已经通过内部的逻辑链条(Chain-of-Thought)解决了之前无法处理的复杂工程问题。现在的模型甚至能把国际数学奥林匹克(IMO)级别的题目当作热身,而一年前人们还在嘲笑它算错三位数加法。
一个细节是,很多用户在抱怨 AI 数学差时,其实忽略了模型版本迭代的速度。从早期的测试版到如今的正式版,针对数学逻辑的专项训练让错误率呈指数级下降。如果你现在尝试用一年前那个帖子里同样的题目去测试,大概率会得到一个正确答案,且附带详细的解题步骤。
我认为这件事最值得深思的是,那些指望 AI “一步登天”、追求绝对完美的人,往往最容易在短期的波动中感到失望;而真正看明白趋势的人,早就在利用这些工具提升生产力了。一年时间,足够让一个被嘲笑为“数学废物”的模型变成大多数人离不开的生产力核心。
我想,这种轮回还会继续。再过一年,可能又会有人翻出今天的某个帖子,嘲笑我们现在还觉得 AI 无法处理某种特定的复杂任务。在 AI 的进化速度面前,任何基于“当前缺陷”而下结论的断言,最终都会变成未来的笑话。
刚用它算完电费居然没出岔子,这逻辑能力进化得有点吓人。