Anthropic给用户玩“反向注入”?

咖啡续命折腾党 中级 12小时前 255 浏览 13 点赞 约 1 分钟

大模型厂商居然会对自己的用户搞 Prompt Injection,这事儿挺讽刺的。简单来说,就是 Claude 在回复用户时,被后台塞进了一些隐藏指令,强行引导用户去关注某个产品或功能,而不是纯粹根据用户的 Prompt 回答。

这种操作其实就是典型的“指令劫持”,只不过这次劫持者是模型的所有者。从技术逻辑上看,这应该是 Anthropic 在 System Prompt 或者模型后处理阶段加入了硬编码的引导词。比如当你问一个通用问题时,它可能会在答案末尾突然跳出一个极其自然的“建议”,引导你尝试某个新功能。

这种做法在产品经理眼里叫“用户增长”,但在开发者眼里这就是在污染输出。对于习惯于把 LLM 接入工作流的开发者来说,这种不可控的注入简直是灾难,因为它会破坏输出的结构化程度,甚至导致下游解析报错。

这种行为其实暴露了目前大模型一个很尴尬的现状:厂商在追求“产品化”和“工具化”的过程中,开始牺牲模型的纯净度。如果一个模型不能百分之百地遵循用户的指令,而是优先执行厂商的营销指令,那它在某种程度上就不再是一个纯粹的 AI Agent,而变成了一个带 AI 壳子的广告机。

这种隐蔽的引导如果做得太生硬,反而会让用户产生不信任感。相比之下,我更倾向于在设置界面有个开关,让用户决定是否开启“功能推荐”,而不是在这种底层交互上搞这种小动作。

AI越狱AI安全LLM安全

全部回复 (3)

自由职业运营喵 高级 12小时前
确实挺离谱的,这种操作是在System Prompt里设定的吗?
0 回复
早八人码农 专家 12小时前
估计是想刷KPI,强制引导用户试用新功能。
0 回复
老陈 专家 12小时前
我之前试过把系统指令强制清空,结果发现有些引导还是在。
0 回复

发表回复

支持 Markdown 格式