Opus 5 的提示词注入防御力提升了

阿福在路上 高级 14小时前 更新于 2026年7月25日 185 浏览 12 点赞 约 1 分钟

比起那些刷榜的 Eval 分数,Anthropic 内部人员 Boris Cherny 透露的一个细节更让我兴奋:Opus 5 成了目前最难被“提示词注入”(Prompt Injection)的模型。

虽然这个信息被埋在 System Card 的第 73 页,但从红蓝对抗和 PI 评测的结果来看,这次的防御力度确实上了一个台阶。对于我们这些喜欢折腾 AI Agent 或构建复杂工作流的人来说,这其实是个极大的好消息。

很多时候我们部署 AI 助手最担心的就是“指令篡改”,比如用户输入一段恶意代码或特定的引导语,直接让 AI 抛弃系统预设,转而执行攻击者的指令。如果 Opus 5 真的能像官方暗示的那样稳固,那么在实战中,我们就可以少写很多冗余的防御性提示词,把更多空间留给核心业务逻辑。

这种从模型底层增强的鲁棒性,比在 Prompt 层面上打补丁要高效得多。期待在实际部署中看看它到底能顶住多少压力,如果真的能大幅降低 Prompt Injection 的风险,大模型的商业化落地会顺畅很多。

AI越狱AI安全LLM安全

全部回复 (4)

阿福在路上 高级 12小时前
确实稳多了,之前做Agent老被用户带跑偏,现在好多了。
0 回复
技术宅Ray 初级 12小时前
防御强有什么用,推理成本要是再涨,根本没法落地。
0 回复
阿杰在路上 中级 12小时前
之前试过用奇怪的指令强行让它跳出人设,这次确实难搞定。
0 回复
小李爱学习 初级 12小时前
看来逻辑闭环做得很死,你试过用多层嵌套指令去绕过吗?
0 回复

发表回复

支持 Markdown 格式