给大模型喂了太多社交准则,结果让 LLM 变得像个死板的教条主义者
目前的 LLM 只要问它“偷东西对不对”,它能写五百字论证不对。但这种第一层级的常识(First-order norms)其实没意义,真正难的是第二层级的社交推理(Metanorms),即:如果有人在特定场合打破了规则,周围的人会怎么反应?是会当众羞辱他,还是因为关系好而选择装没看见?实测发现,现在的模型在预测社交反应时极其刻板,倾向于过度预测惩罚,完全不懂人类社交中的“宽容”和“关系校准”。
LLM 为什么在预测社交反应时会失效
大多数模型的对齐(Alignment)是基于“正确答案”训练的,这导致它们在面对 NormReact 这种包含 450 个真实违规场景的数据集时,表现出一种诡异的“严苛感”。
我对比了六个主流模型的推理逻辑,发现一个共性:只要场景中出现了“违规”行为,模型在预测观察者(Observer)的反应时,会极高概率地给出“谴责”或“制裁”的选项。而人类在真实社交中,会根据社交距离(Social Closeness)来调整反应。比如好友之间迟到半小时,人类可能觉得没关系,但 LLM 倾向于认为这违反了社交礼仪,应该受到指责。
这种偏差在社交距离增加时更明显。当场景设定为陌生人之间时,模型预测的负面制裁率远高于人类标注的实际情况。这意味着如果你用 LLM 来模拟社会冲突或预测政策反馈,它给你的结果大概率是一个过度惩罚、缺乏人情味的冷酷世界。
实测中发现的两个核心维度缺陷
在评估模型对“元准则”推理能力时,主要考察两个点:情感评估(Emotional Appraisal)和行为响应(Behavioral Response)。
- 情感评估的偏差:模型能识别出某种行为是“错的”,但它无法准确模拟观察者在不同关系维度下的情感波动。它把社交准则当成了法律条文,而不是动态的心理博弈。
- 行为响应的僵化:在预测违规者是否会进行自我调节(Self-regulation)或观察者是否会进行他人调节(Other-regulation)时,模型缺乏对“克制”的理解。
对比判断与实际应用风险
如果你在开发一个需要处理复杂人际关系的 AI Agent,千万不要直接相信它对“社交得体性”的判断。
- 在冲突调解场景中:LLM 可能会建议你采取过于强硬的姿态,因为它认为对方违规了就必须被纠正,而忽略了维护关系的必要性。
- 在政策模拟中:它会高估人们对违规行为的反感程度,导致模拟结果与实际社会心理脱节。
- 在客服机器人中:如果它基于这种逻辑去判断用户的抱怨是否“合理”,可能会在潜意识里将用户标记为“违规者”从而给出机械化的正确回复,而非真正的情绪安抚。
总结:如何修正这种“教条感”
要让模型在社交推理上更像人,不能再简单地喂“正确答案”数据集,而应该增加带有社交距离权重(Relationship Weight)的对比样本。
目前的结论是:LLM 掌握了社交的“法典”,但完全没学会社交的“潜规则”。在处理社交距离较远、且违规程度较低的场景时,给模型的 Prompt 必须明确要求它考虑“人类的宽容度”和“非正式的社交习惯”,否则它会一直扮演那个在办公室里死磕考勤制度、不通人情的HR。
太真实了,我之前试着让它分析职场潜规则,结果它给我整了一套员工手册,完全不懂什么叫“看老板脸色”。