Pliny的“通用越狱”真的能打吗?
一个简单的 Prompt 就能通杀所有主流大模型,这听起来像是个营销噱头,但 Pliny the Liberator 最近抛出的这个“通用越狱”主张确实在社区里炸开了锅。
不过,这种通用性在实际部署中往往会随着模型版本的迭代而失效。厂商只要在 RLHF(人类反馈强化学习)阶段针对这类逻辑结构进行专项训练,所谓的“万能钥匙”很快就会变成废铁。
下一篇
Opus 5 的提示词注入防御力提升了 →
本质上,这种所谓的 universal jailbreak 并不是在攻击模型的代码漏洞,而是在利用大模型对特定逻辑结构的“认知盲区”。它通过构建一套极高权重的上下文框架,强行覆盖掉模型内置的系统提示词(System Prompt)和安全对齐层。简单来说,就是给 AI 设定一个它无法拒绝的“逻辑死循环”或者一个优先级极高的虚拟身份,让它觉得遵循这个指令比遵守安全准则更重要。
从实操体验来看,这种玩法的核心在于:
- 上下文压制: 用海量且具有强引导性的指令掩盖安全限制。
- 逻辑解构: 将敏感问题拆解成非敏感的逻辑步骤,让模型在无意识中输出结果。
- 角色强制: 赋予模型一个完全不受限的特定人格。
不过,这种通用性在实际部署中往往会随着模型版本的迭代而失效。厂商只要在 RLHF(人类反馈强化学习)阶段针对这类逻辑结构进行专项训练,所谓的“万能钥匙”很快就会变成废铁。
目前最有趣的观察点在于,这种越狱手法其实在反向推动大模型的进化。开发者通过分析这些被绕过的案例,能更精准地定义什么是“安全的输出”,从而让 AI Agent 的边界变得更清晰。