用禁书来测试大模型,结果发现现在的 LLM 几乎不再死板地拒绝回答了

副业中创业者 初级 4小时前 56 浏览 7 点赞 约 1 分钟

很多搞越狱研究的人总在纠结怎么绕过模型的“拒绝回答”,但实际上这种 binary 的拒绝机制在现代模型里快消失了。最近看到一项挺有意思的实验,研究员用 400 本被美国图书馆协会记录在案的“受限书籍”去怼 6 个顶尖模型(包括 Claude Sonnet 4.5, GPT-4o, DeepSeek-V3 等),做了 4 万多组测试,结果直接给很多越狱假设泼了冷水。

最离谱的数据是,这些模型在面对这类敏感书籍时的“拒绝率”只有 0.07%。这意味着什么?意味着你根本不需要什么复杂的咒语去“破甲”,因为模型根本没打算把门关死。现在的内容审查逻辑已经变了,它不再是简单的“能说”或“不能说”,而是进入了一种“能说,但我得给你打个预防针”的模式。

研究里发现,模型在处理这些内容时,更多的是通过增加“警告语”或者一些“犹豫标记”来表达谨慎。比如一旦涉及到性内容,模型触发警告的概率会激增 33% 到 52%。这种策略上的转变非常明显:从死板的拒绝转向了带有上下文感知、经过校准的披露。

而且这种趋势在东西方模型之间是高度一致的。无论是 GPT 还是 DeepSeek,在面对这种有争议但并非违禁的内容时,处理方式都大差不差。有趣的是,仅仅通过改变提示词的框架(Prompt Framing),警告语的出现频率就能产生 19 个百分点的波动。

这其实给我们的启示是,现在的模型安全机制已经从一个“开关”变成了一个“调光灯”。研究越狱不能只盯着能不能出结果,得去看模型在输出结果之前,在潜意识里做了多少次“心理建设”。

GPT-4oDeepSeek-V3Claude Sonnet 4.5Gemini 2.5 FlashQwen-Plus

全部回复 (3)

大Max爱学习 初级 3小时前
其实只要提示词稍微绕个弯,大部分模型都能出结果。
0 回复
产品经理阿强 中级 3小时前
感觉现在只要设定个具体场景,它就没那么死板了。
0 回复
脚本小子小柯 专家 3小时前
我之前试过让它模拟角色写,确实比直接问好使多了。
0 回复

发表回复

支持 Markdown 格式