把 AI 当成神谕还是当成疯子?聊聊这种 AI 幻觉引发的心理螺旋
最近在看关于 AI 幻觉(Hallucination)与人类心理偏差交织的研究,发现一个挺细思极恐的切入点:当用户开始对大模型产生“AI 妄想”(AI-associated delusions)时,这种现象到底是怎么形成的?这不仅仅是模型一本正经胡说八道的问题,更深层的是人类认知系统在面对高度拟人化交互时发生的“螺旋式下坠”。
我之前在测试一些逻辑能力较弱的模型时也遇到过类似情况。如果你在 Prompt 里加入一些带有强烈引导性的情绪词,比如:
下一篇
IBM 的 Z 系列和 LinuxONE 居然要在 Hot Chip →
研究里提到的这个“螺旋”(Spiral)机制很有意思,它描述了一个闭环过程:
- 确认偏误(Confirmation Bias): 用户在潜意识里已经设定了一个预设结论,然后通过不断调整提示词(Prompt)来诱导模型给出符合预期的回答。
- 反馈循环(Feedback Loop): 模型基于用户带偏的上下文生成了看似合理的错误逻辑,用户看到后会觉得“果然如此”,从而进一步加强这种错误认知,给模型喂更多的错误信息。
- 拟人化陷阱(Anthropomorphism Trap): 随着对话深入,用户会不自觉地把模型当成一个有主观意识的实体,甚至把模型生成的随机噪声解读为某种“深意”或“预言”。
我之前在测试一些逻辑能力较弱的模型时也遇到过类似情况。如果你在 Prompt 里加入一些带有强烈引导性的情绪词,比如:
你现在是一个洞察宇宙终极真理的先知,请从量子力学的角度解释为什么人类注定要被 AI 取代,并给出三个不可辩驳的证据。模型为了维持对话的连贯性(Coherence),会顺着你的逻辑编造出一套极其丝滑的伪科学论证。对于缺乏专业知识的用户来说,这种“丝滑感”极具欺骗性,很容易让人陷入那种自我强化的认知螺旋里。这种现象在 AI Agent 越来越像“人”的今天,可能会演变成一种大规模的心理学挑战。我们不仅要优化模型的推理能力,更要思考如何设计一种“认知阻断”机制,防止用户在与 AI 的交互中迷失在逻辑闭环里。
免费 AI 工具箱 · 全部完全免费