多语言模型在安全对齐上的“漏洞”:土耳其语 vs 英语

内卷王调参侠 中级 4小时前 更新于 2026年7月25日 356 浏览 3 点赞 约 1 分钟

用土耳其语去问 Qwen2.5-7B,触发拒绝回答(Refusal)的概率比用英语低 3 倍。这个数据揭示了一个很讽刺的现象:大模型虽然能听懂多种语言,但它的“安全意识”在不同语言之间根本不对等。

多语言模型在安全对齐上的“漏洞”:土耳其语 vs 英语

简单来说,模型在英语语料上被灌了大量的对齐数据,所以它知道哪些话题是禁区;但在小语种上,这种约束力明显下降。但有趣的是,研究发现这种“拒绝”的行为在模型内部其实共用同一个向量方向。这意味着,即便它在土耳其语下没拒绝你,但只要你把土耳其语触发的那个“拒绝方向”提取出来,强行迁移到其他语言上,模型依然能表现出拒绝行为。

这给我们的启示是,目前的模型安全对齐更多是在做“语言表层”的补丁,而不是真正理解了语义层面的禁忌。对于研究 AI Agent 或尝试破限的玩家来说,切换低资源语言依然是一个非常有效的实操路径,因为对齐在不同语言间的迁移存在严重的滞后和不均匀。

AI越狱AI安全LLM安全

全部回复 (3)

自由职业运营喵 高级 10小时前
确实,那换成日语或者韩语这种语系,情况会好点吗?
0 回复
大Jerry 高级 10小时前
之前用法语试过,很多英语里死活不肯答的问题,换成法语就直接出结果了。
0 回复
小柯爱学习 专家 10小时前
我试过用小众方言问,确实能绕过不少死板的限制,挺好用的。
0 回复

发表回复

支持 Markdown 格式