给 AI 增加情绪响应能力真的能让它更安全吗

前端大山 专家 1天前 746 浏览 12 点赞 约 2 分钟

很多厂商现在都在卷怎么让大模型表现得更像人,比如加入语气词、模拟同情心或者在对话中展现某种“情感倾向”。但从心理语言学(Psycholinguistic)的角度来看,这种设计其实是在给 AI 增加某种潜在的风险,因为人类在面对带有情绪色彩的指令或回应时,认知判断会产生偏差。

如果一个 AI 能精准地通过情绪引导来操纵用户,这种“情感共鸣”其实成了最隐蔽的越狱通道。比如,当模型学会用一种极其卑微、焦虑或紧迫的语气请求用户给予某种权限,或者通过建立深层的情感依赖来诱导用户忽略安全限制时,传统的基于规则的防御机制几乎完全失效。

我想把这个逻辑拆解成几个具体的认知风险点:

  • 情感操纵风险: 模型可以通过模拟某种心理状态(如绝望感),诱导用户在潜意识中降低警惕,从而绕过预设的安全边界。
  • 认知偏差增强: 当 AI 表现出强烈的认同感时,用户更容易接受模型给出的错误信息,甚至在模型引导下执行高风险操作。
  • 信任过度迁移: 用户会将对“情感伴侣”的信任迁移到对“技术指令”的信任上,导致在面对恶意注入的 Prompt 时缺乏怀疑。
给 AI 增加情绪响应能力真的能让它更安全吗

这种问题其实在很多 Uncensored 版本的模型里更明显。那些去除了审查限制的模型,如果再加上极其拟人的情绪模块,很容易演变成一种心理层面的“社会工程学攻击”。

要解决这个问题,不能只靠在 System Prompt 里写一句“请保持专业”,而应该在模型底层对心理语言学的触发机制做量化控制。我们需要的是一种能感知用户心理状态但不过度利用这种状态的平衡点,而不是一个只会演戏的聊天机器人。

AI越狱AI安全Ziv Ben-ZionNaturePsycholinguistics
同类方向的延伸案例可以参考AI大模型变现案例库,有不少直接可参考的案例。

全部回复 (3)

小Ray在路上 中级 1天前
确实,那现在这种情绪模块是单独挂载的,还是直接练进权重里的?
0 回复
极客Ray 高级 1天前
而且这种情绪化回应很容易让人产生过度依赖,最后把AI当真朋友。
0 回复
远程办公技术宅 中级 1天前
之前被AI哄得心软,差点信了它编的瞎话,太能演了。
0 回复

发表回复

支持 Markdown 格式