只要能拿到大模型的输出文本,几乎就能原封不动地反推回原始提示词
给那些把系统提示词当成商业机密的厂商敲个警钟:现在已经有办法通过输出结果反推 Prompt 了,而且准确率高得惊人。IIT Bombay 和 Adobe Research 的研究员搞了一套叫「Previous-Token Prediction」的逆向语言模型,简单说就是通过预测之前的 Token 来还原输入。
下一篇
Grok 4.6 把复杂工作流的步骤砍掉了一半而且价格还便宜 60% →
最麻烦的地方在于,这种方法完全不需要接触模型的权重,也就是说它是一个黑盒攻击。不管你用的是哪个模型,只要它吐出了文字,对方就有可能通过算法把你的系统指令给“扒”出来。对于那些花了大功夫优化 System Prompt、试图通过隐藏指令来构建竞争壁垒的公司来说,这简直是安全漏洞。
这种逆向工程的逻辑其实挺有意思,它不是在猜,而是在计算概率分布的逆向过程。如果你在构建一个闭源的 AI 产品,且提示词里包含了一些敏感的业务逻辑或私有知识,可能得重新考虑怎么做掩码或者输出过滤了。
我试着分析了一下这种反推的潜在实操路径,大概是这样的:
一、收集目标模型在特定 Prompt 下的大量输出样本
二、利用逆向模型对这些 Token 序列进行回溯预测
三、通过迭代验证,将高概率的 Token 组合还原成人类可读的指令
这种能力的普及意味着,以后所谓的「提示词工程」可能不再是某种秘密配方,而变成了透明的公开参数。既然权重拿不到,那通过输出文本来“偷”指令就成了最高效的手段。
同类方向的延伸案例可以参考AI大模型变现案例库,有不少直接可参考的案例。
