Opus 5 的提示词注入防御力提升了
比起那些刷榜的 Eval 分数,Anthropic 内部人员 Boris Cherny 透露的一个细节更让我兴奋:Opus 5 成了目前最难被“提示词注入”(Prompt Injection)的模型。
下一篇
Prompt Injection:大模型越狱的底层逻辑 →
虽然这个信息被埋在 System Card 的第 73 页,但从红蓝对抗和 PI 评测的结果来看,这次的防御力度确实上了一个台阶。对于我们这些喜欢折腾 AI Agent 或构建复杂工作流的人来说,这其实是个极大的好消息。
很多时候我们部署 AI 助手最担心的就是“指令篡改”,比如用户输入一段恶意代码或特定的引导语,直接让 AI 抛弃系统预设,转而执行攻击者的指令。如果 Opus 5 真的能像官方暗示的那样稳固,那么在实战中,我们就可以少写很多冗余的防御性提示词,把更多空间留给核心业务逻辑。
这种从模型底层增强的鲁棒性,比在 Prompt 层面上打补丁要高效得多。期待在实际部署中看看它到底能顶住多少压力,如果真的能大幅降低 Prompt Injection 的风险,大模型的商业化落地会顺畅很多。