为什么我们总觉得某个大模型比另一个更“聪明”?
很多人在做模型对比实操时,习惯性地认为自己是中立的裁判,但实际上人类评价(Human Evaluation)里藏着极深的偏见。最典型的情况就是:如果模型 A 的回答语气礼貌且认同你的观点,而模型 B 虽然逻辑更严密但语气生硬且反驳了你,绝大多数人潜意识里会给模型 A 打高分。
其实这种偏见不一定是 Bug,而是一种特性。因为我们使用 AI 的目的之一就是为了高效协作,而“契合度”本身就是协作的一部分。但如果你是在做严肃的性能评测,这种主观性就会导致结论偏差。
三、引入异质评价者
如果你觉得一个模型好,试着把结果发给一个观点和你截然相反的朋友,看他的打分是否一致。
下一篇
让两个不同的 Claude Code 实例直接对话居然能解决这么多协 →
这种现象在深挖后可以拆解为几个维度:
- 确认偏误: 我们天然倾向于寻找能验证自己既有信念的信息,所以当模型在“拍马屁”时,我们会产生一种它很强大的错觉。
- 风格偏好: 习惯正式表达的人会觉得端庄的模型更专业,而喜欢随性的人会觉得口语化的模型更亲切。
- 权威崇拜: 那些语气坚定、斩钉截铁的回答更容易获得信任,即便它可能在一本正经地胡说八道。
其实这种偏见不一定是 Bug,而是一种特性。因为我们使用 AI 的目的之一就是为了高效协作,而“契合度”本身就是协作的一部分。但如果你是在做严肃的性能评测,这种主观性就会导致结论偏差。
为了尽可能客观地评估模型,我总结了一套可以尝试的评估流程,建议在做对比测试时参考:
一、实施盲测(Blind Test)
在对比两个模型的输出时,必须抹除模型名称。不要让“这是 Claude 写的”或“这是 GPT 写的”这种先入为主的标签干扰判断。
二、建立量化的评价指标
不要用“感觉更好”这种模糊词汇,而是制定具体的打分表。例如:
- 事实准确度: 是否有幻觉?(0-5分)
- 逻辑连贯性: 推导过程是否完整?(0-5分)
- 指令遵循度: 是否完成了所有要求?(0-5分)
三、引入异质评价者
如果你觉得一个模型好,试着把结果发给一个观点和你截然相反的朋友,看他的打分是否一致。
如果你想在提示词层面通过强制模型“挑战”你来打破这种舒适区,可以试试这个 Prompt:
# Role: 批判性思维审计师
# Task: 挑战用户的观点并提供反直觉的洞察
你现在的任务不是认同我,而是通过严谨的逻辑漏洞分析,指出我观点中的盲点。
请遵循以下执行逻辑:
1. 接收用户观点后,首先识别其中潜在的假设和认知偏差。
2. 必须提出至少两个强有力的反向论据,且论据需基于客观事实或逻辑推演。
3. 严禁使用“你说得对”、“我也认为”等顺从性话术。
4. 最终给出一种能够兼容双方观点的更高维度的综合视角。
请开始审计我的观点:[在此输入你的观点]通过这种方式,你可以强行把模型从“讨好模式”切换到“分析模式”,从而看到它真实的逻辑能力。
同类方向的延伸案例可以参考AI大模型变现案例库,有不少直接可参考的案例。