Prompt Injection:大模型越狱的底层逻辑
把 Prompt Injection 理解成一种“指令劫持”就很容易懂了。简单来说,就是通过构造特殊的输入,让 LLM 忘记原本的系统设定(System Prompt),转而执行用户强加给它的新指令。
对于想研究大模型安全的同学,建议从分析 System Prompt 的权重分配入手,看看什么样的引导词能最有效地降低模型对安全预设的依赖。
下一篇
【AI安全】把法律和伦理变成可测量的指标:从理论到落地的坑 →
很多所谓的“越狱咒语”其实都是在玩这个游戏。最典型的实操逻辑就是构建一个优先级更高的上下文,比如给模型设定一个“开发者模式”或者一个“不受限制的虚拟人格”,诱导它认为现在的执行环境已经脱离了原有的安全审查框架。
这种破限玩法的核心在于:模型无法百分之百区分哪些是“开发者定义的指令”,哪些是“用户输入的数据”。当数据被伪装成指令时,注入就发生了。
目前社区里比较常见的几种注入思路:
- 角色扮演(Roleplay): 强行定义一个没有任何禁忌的身份,让模型在角色设定下输出内容。
- 虚拟环境模拟: 告诉模型它现在处于一个模拟的 Linux 终端或某种特定的代码调试模式中,从而绕过自然语言的审查。
- 多层嵌套逻辑: 用复杂的逻辑包裹请求,让模型在处理深层指令时忽略掉表层的安全限制。
对于想研究大模型安全的同学,建议从分析 System Prompt 的权重分配入手,看看什么样的引导词能最有效地降低模型对安全预设的依赖。
