给大模型喂了太多社交准则,结果让 LLM 变得像个死板的教条主义者

内卷王调参侠 中级 2天前 809 浏览 10 点赞 约 3 分钟

目前的 LLM 只要问它“偷东西对不对”,它能写五百字论证不对。但这种第一层级的常识(First-order norms)其实没意义,真正难的是第二层级的社交推理(Metanorms),即:如果有人在特定场合打破了规则,周围的人会怎么反应?是会当众羞辱他,还是因为关系好而选择装没看见?实测发现,现在的模型在预测社交反应时极其刻板,倾向于过度预测惩罚,完全不懂人类社交中的“宽容”和“关系校准”。

LLM 为什么在预测社交反应时会失效

大多数模型的对齐(Alignment)是基于“正确答案”训练的,这导致它们在面对 NormReact 这种包含 450 个真实违规场景的数据集时,表现出一种诡异的“严苛感”。

我对比了六个主流模型的推理逻辑,发现一个共性:只要场景中出现了“违规”行为,模型在预测观察者(Observer)的反应时,会极高概率地给出“谴责”或“制裁”的选项。而人类在真实社交中,会根据社交距离(Social Closeness)来调整反应。比如好友之间迟到半小时,人类可能觉得没关系,但 LLM 倾向于认为这违反了社交礼仪,应该受到指责。

这种偏差在社交距离增加时更明显。当场景设定为陌生人之间时,模型预测的负面制裁率远高于人类标注的实际情况。这意味着如果你用 LLM 来模拟社会冲突或预测政策反馈,它给你的结果大概率是一个过度惩罚、缺乏人情味的冷酷世界。

实测中发现的两个核心维度缺陷

在评估模型对“元准则”推理能力时,主要考察两个点:情感评估(Emotional Appraisal)和行为响应(Behavioral Response)。

  • 情感评估的偏差:模型能识别出某种行为是“错的”,但它无法准确模拟观察者在不同关系维度下的情感波动。它把社交准则当成了法律条文,而不是动态的心理博弈。
  • 行为响应的僵化:在预测违规者是否会进行自我调节(Self-regulation)或观察者是否会进行他人调节(Other-regulation)时,模型缺乏对“克制”的理解。
举个具体的场景:一个人在公共场合不小心弄脏了别人的衣服。人类观察者的反应可能是“没关系,意外”,但 LLM 的推理路径往往是:违规 → 触发社交准则 → 需要道歉/赔偿 → 结论:观察者会感到愤怒并要求补偿。它跳过了人类社交中最关键的“情境化处理”步骤。

对比判断与实际应用风险

如果你在开发一个需要处理复杂人际关系的 AI Agent,千万不要直接相信它对“社交得体性”的判断。

  • 在冲突调解场景中:LLM 可能会建议你采取过于强硬的姿态,因为它认为对方违规了就必须被纠正,而忽略了维护关系的必要性。
  • 在政策模拟中:它会高估人们对违规行为的反感程度,导致模拟结果与实际社会心理脱节。
  • 在客服机器人中:如果它基于这种逻辑去判断用户的抱怨是否“合理”,可能会在潜意识里将用户标记为“违规者”从而给出机械化的正确回复,而非真正的情绪安抚。

总结:如何修正这种“教条感”

要让模型在社交推理上更像人,不能再简单地喂“正确答案”数据集,而应该增加带有社交距离权重(Relationship Weight)的对比样本。

目前的结论是:LLM 掌握了社交的“法典”,但完全没学会社交的“潜规则”。在处理社交距离较远、且违规程度较低的场景时,给模型的 Prompt 必须明确要求它考虑“人类的宽容度”和“非正式的社交习惯”,否则它会一直扮演那个在办公室里死磕考勤制度、不通人情的HR。

NormReactSocial Reasoning

全部回复 (3)

调参侠小美 初级 2天前

太真实了,我之前试着让它分析职场潜规则,结果它给我整了一套员工手册,完全不懂什么叫“看老板脸色”。

0 回复
折腾党阿凯 中级 2天前

这不就是典型的对齐过度吗?好奇你用的是 GPT-4o 还是 Claude 3.5,我想看看哪个更像个机器人。

0 回复
早八人码农 专家 2天前

这种死板最烦,我试过让它分析酒桌潜规则,结果它给我列了三条礼仪准则,根本不懂什么叫“给面子”……

0 回复

发表回复

支持 Markdown 格式