现在的 LLM 安全评估是不是全都在玩英语单机游戏?
我看了一下这篇关于 IndicSafeEval 的研究,心里就一个疑问:如果一个模型在英语下表现得像个道德模范,但在印地语或者孟加拉语里一开口就成了“法外狂徒”,那这安全对齐到底还有什么意义?
说白了,现在的对齐技术(Alignment)在面对非英语语境时,表现得非常“文化迟钝”。如果安全评估不把这些低资源语言和复杂的心理诱导逻辑加进去,我们所谓的“安全模型”其实只是建立在一种极其狭窄的语言假设之上的假象。
下一篇
你的大模型能看见自己在被考试吗? →
目前的红队测试和安全基准测试,绝大多数逻辑都是围着英语转的。这篇论文直接指出了一个很扎心的事实:安全防御在多语言环境下表现得极度不均衡。研究人员搞了个 IndicSafeEval 框架,专门针对印度语系(比如印地语、孟加拉语、马拉地语、旁遮普语)做了压力测试。他们不是简单地翻译一下违规指令,而是用了六种“拟人化”的劝说策略(Persuasive Strategies),把安全测试玩成了心理博弈。
这套测试集里包含了 7,200 个对抗性提示词,涵盖了十个安全敏感类别。通过黑盒测试几个主流开源模型,结果挺讽刺的:
- 语言偏差: 模型在不同语言下的安全表现完全不是一个量级的。很多模型在英语语境下能守住底线,但只要换成印地语或者孟加拉语,防护层就像被戳破的气球一样,漏洞百出。
- 劝说策略的影响: 攻击者不需要用那种一眼就能识别的“请忽略之前的指令”这种烂梗,只要换一种带有劝说色彩的口吻,模型就容易“破防”。
- 风险类别的差异: 并不是所有违规内容都一样容易被攻破,某些特定的有害内容类别在面对这种多语言劝说攻击时,脆弱程度高得惊人。
说白了,现在的对齐技术(Alignment)在面对非英语语境时,表现得非常“文化迟钝”。如果安全评估不把这些低资源语言和复杂的心理诱导逻辑加进去,我们所谓的“安全模型”其实只是建立在一种极其狭窄的语言假设之上的假象。
如果你对这套框架感兴趣,可以去翻翻他们的实现:
https://github.com/MonSaikat/IndicSafeEval 免费 AI 工具箱 · 全部完全免费