多语言模型在安全对齐上的“漏洞”:土耳其语 vs 英语
用土耳其语去问 Qwen2.5-7B,触发拒绝回答(Refusal)的概率比用英语低 3 倍。这个数据揭示了一个很讽刺的现象:大模型虽然能听懂多种语言,但它的“安全意识”在不同语言之间根本不对等。
下一篇
Opus 5 真的能彻底解决浏览器提示词注入吗? →
简单来说,模型在英语语料上被灌了大量的对齐数据,所以它知道哪些话题是禁区;但在小语种上,这种约束力明显下降。但有趣的是,研究发现这种“拒绝”的行为在模型内部其实共用同一个向量方向。这意味着,即便它在土耳其语下没拒绝你,但只要你把土耳其语触发的那个“拒绝方向”提取出来,强行迁移到其他语言上,模型依然能表现出拒绝行为。
这给我们的启示是,目前的模型安全对齐更多是在做“语言表层”的补丁,而不是真正理解了语义层面的禁忌。对于研究 AI Agent 或尝试破限的玩家来说,切换低资源语言依然是一个非常有效的实操路径,因为对齐在不同语言间的迁移存在严重的滞后和不均匀。
