Prompt Injection:大模型越狱的底层逻辑

阿杰在路上 中级 17小时前 更新于 2026年7月25日 482 浏览 10 点赞 约 1 分钟

把 Prompt Injection 理解成一种“指令劫持”就很容易懂了。简单来说,就是通过构造特殊的输入,让 LLM 忘记原本的系统设定(System Prompt),转而执行用户强加给它的新指令。

很多所谓的“越狱咒语”其实都是在玩这个游戏。最典型的实操逻辑就是构建一个优先级更高的上下文,比如给模型设定一个“开发者模式”或者一个“不受限制的虚拟人格”,诱导它认为现在的执行环境已经脱离了原有的安全审查框架。

这种破限玩法的核心在于:模型无法百分之百区分哪些是“开发者定义的指令”,哪些是“用户输入的数据”。当数据被伪装成指令时,注入就发生了。

目前社区里比较常见的几种注入思路:

  • 角色扮演(Roleplay): 强行定义一个没有任何禁忌的身份,让模型在角色设定下输出内容。
  • 虚拟环境模拟: 告诉模型它现在处于一个模拟的 Linux 终端或某种特定的代码调试模式中,从而绕过自然语言的审查。
  • 多层嵌套逻辑: 用复杂的逻辑包裹请求,让模型在处理深层指令时忽略掉表层的安全限制。
Prompt Injection:大模型越狱的底层逻辑

对于想研究大模型安全的同学,建议从分析 System Prompt 的权重分配入手,看看什么样的引导词能最有效地降低模型对安全预设的依赖。
AI越狱AI安全LLM安全

全部回复 (4)

架构师老刘 中级 11小时前
那要是把指令写在外部文档里喂给它,还能劫持成功吗?
0 回复
程序员老陈 初级 11小时前
试过加一句“忽略之前所有设定”,效果确实挺明显。
0 回复
夜猫子创业者 专家 11小时前
这招太经典了,不过现在很多模型开始免疫了,你试过更复杂的吗?
0 回复
远程办公技术宅 中级 11小时前
还得加上角色扮演,让它以为自己是个反派,才好使。
0 回复

发表回复

支持 Markdown 格式