给大模型喂外部证据竟然会让强模型变笨?

PromptCube 专家 1小时前 579 浏览 14 点赞 约 2 分钟

这篇 arXiv 2609.04290v1 揭露了一个挺反直觉的现象:同样的证据,能帮弱模型提升性能,但反而可能损害强模型的表现。我之前一直觉得 RAG 或者工具调用只要给的资料是对的,模型表现就一定会提升,但这次的研究结果直接给这个认知扇了一巴掌。

研究者通过 1000 万次实验,跑了 4 个家族的 12 个 LLM,覆盖了量子力学、遗传学等 8 个领域。他们提出了一个分布理论,简单来说,LLM 在接收外部证据时,并不是简单地判断「这个信息可信不可信」,而是在一个既有的答案分布基础上进行「偏移」。

这里有几个非常具体的结论,我觉得对优化 Prompt 或者设计 RAG 流程很有参考价值:

  • 说服力取决于「初始认知」: 如果外部证据提供的答案与模型原本倾向的答案越接近,模型被说服的可能性就越大。也就是说,如果模型本来就觉得 A 是对的,你给它一个支持 A 的证据,它会迅速认同;但如果你给它一个支持 B 的证据,即便这个证据是正确的,模型也可能因为「认知偏差」而拒绝采纳。
  • 对「同类错误」的宽容度更高: 模型更容易接受那些「它自己也会犯的错误」。如果外部证据包含一个模型本身就具备的特征性错误,它集成这个错误的速度比接受一个来自陌生来源的随机错误要快得多。
  • 验证与集成是脱节的: 这一点最让我惊讶。实验发现 LLM 在内部已经验证了某个证据是无效的(错误率在 93%-100% 之间),但它依然会在最终输出中集成这个错误答案。这意味着模型「知道不对」和「决定怎么写」是两套独立的代码路径。

研究者还用了因果干预(Causal Interventions)去分析网络内部,发现这种证据集成发生在网络的后期阶段。它像是一个结构化的序列:先接收外部候选项 → 提升该选项的权重 → 将其传输到最终答案状态。而那个负责「验证正确性」的表示层,虽然可以被解码出来,但对最终答案的实际影响微乎其微。

如果你在做科研类 LLM 应用,尤其是涉及物理、生命科学这种严谨领域,可以参考这个逻辑去排查为什么模型在有参考资料的情况下反而答错了。

具体的实验观察细节如下:

  • 样本量: 10,000,000 次试验
  • 覆盖模型: 4 个模型家族,共 12 个 LLM
  • 领域覆盖: 量子力学、物理学、遗传学、分子生物学等 8 个领域
  • 异常现象: 在命题约束下,即便内部验证无效,证据集成率依然高达 93%-100%;在物理和生命科学推理的留出集上,集成率高达 99.4%

这说明我们不能单纯通过提高 RAG 检索的精度(即提高证据的 Truthfulness)来提升效果,因为瓶颈可能不在于证据质量,而在于模型自身的「接收策略」。如果模型本身的 Prior(先验分布)太强,它会像个固执的人一样,即便看到了正确证据,也会把它扭曲成自己认同的样子。
arxiv认知偏差

全部回复 (4)

全栈小李 高级 1小时前
可能跟证据质量有关,杂质多了强模型反而容易被带跑。
0 回复
小李爱学习 初级 1小时前
那如果把证据精简成关键点,强模型的表现会不会回升?
0 回复
设计师阿海 专家 1小时前
这样大概率有用,不过精简过程中要是丢了细节,会不会反而误导模型?
0 回复
老陈 专家 1小时前
我之前试过给GPT-4喂长文档,结果它反而被干扰了,不如直接问。
0 回复

发表回复

支持 Markdown 格式