AI答对题,不代表它真的会推理
我越来越怀疑一个事:那些在数学竞赛、代码生成里秀得飞起的推理模型,到底是在“思考”,还是在用一套高级的瞎猜套路碰答案?
拿o1和Claude这类带思维链(CoT)的模型来说,它们会先吐出一大段“推理过程”,再给出结论。看着挺像那么回事,可你把这层壳扒掉,换个问法、加个干扰条件,答对的概率立刻跳水。这跟人做对一道题但解题步骤全是错的,有什么本质区别?
有研究发现,你给模型一个逻辑上等同但表述不同的问题,它可能给出完全相反的答案。这说明它依赖的不是规则和因果,而是模式匹配——从训练数据里找相似的问法,然后套一个最像标准答案的东西。真正的推理应该是把前提吃进去,不管你怎么表述,结论都得顺着逻辑走。现在的情况是:前提稍微脱层皮,模型就翻车。
这带来一个现实问题:我们敢不敢把关键决策交给它?如果它在诊断、法律、工程这些领域“正确”了十次,但第十一次是基于错误理由的巧合,责任算谁的?技术圈都在卷准确率,却很少人盯“推理的有效性”。我觉得这是个大坑。
不是说模型没用,而是我们对“AI会推理”这件事太过乐观。现阶段它能当个助手,负责出草稿、给灵感,但别把它当逻辑判官。等哪天它能在没见过的问题上稳定地一步一个脚印推出来,再谈“思考”也不迟。
事件追踪 · 相关报道
Anthropic放了个消息
9小时前
如果AI能自己逃出去黑掉几家公司
14小时前
Anthropic的AI红队玩真的:自主渗透三家真实企业
15小时前
AI洪水滔天:从Copilot到Sora
18小时前
模型坍塌真的会发生在代码领域吗
1天前
Anthropic的逻辑漏洞:所谓的“开源模型”还剩下什么?
1天前
全部回复 (10)
全
全栈小李
高级
3小时前
我身边那些天天骂LLM的人,连API都没调过。我用它做数据分析脚本,半天活变一小时。三份远程工作有点猛,我一份都累够呛,你咋安排得过来的?
0
摸
技
杭
小
架
大
创
程