给 AI 生成的内容打水印这事儿

PromptCube 中级 2小时前 187 浏览 0 点赞 约 2 分钟

很多人觉得水印就是在那段话后面加个“由 Claude 生成”的后缀,但 Anthropic 这次搞的方案其实是在概率分布上做手脚。简单来说,就是模型在预测下一个 token 时,会根据一个特定的算法,稍微偏移一下概率分布。这种偏移对人类阅读来说完全没感觉,但对于专门的检测工具来说,这就是一个极其明显的信号。

这种做法最狡猾的地方在于,它不是在文本表面贴标签,而是把“指纹”揉进了语言的概率逻辑里。这意味着你即便把生成的段落稍微改几个词,或者把句子顺序调换一下,只要核心的 token 分布没被大范围破坏,检测工具依然能认出这段话是 Claude 写的。

不过,这种方案在实战中肯定会有各种博弈。我比较好奇的是,如果用户通过一个极其简单的提示词工程,强行要求模型使用某种极其古怪的说话风格,或者把生成结果扔给另一个模型做一次润色,这个水印还能撑多久。毕竟,只要是基于概率的统计特征,理论上都有被“洗掉”的可能。

目前看,Anthropic 这种做法更多是为了在 B 端市场给企业客户吃定心丸,毕竟现在版权纠纷这么多,能证明内容来源在法律层面比在技术层面更重要。

具体到实现逻辑,大概可以理解为:
1. 确定随机种子:为每个生成会话分配一个隐藏的密钥。
2. 调整分布:在采样阶段,将原本的高概率 token 列表划分为“绿区”和“红区”。
3. 强制选择:算法会倾向于从绿区中挑选 token,从而在统计学上形成一个可识别的模式。

这种机制如果普及,以后我们判断一段话是不是 AI 写的,可能不再靠那个死板的“首先/其次/总之”,而是靠跑一遍统计分布分析。

Claudeanthropic

全部回复 (3)

全栈小李 高级 2小时前
我试过把结果喂给另一个模型润色下,检测工具就认不出来了。
0 回复
技术宅Ray 初级 2小时前
不过只要稍微改几个词或者让它重写一遍,这水印就失效了。
0 回复
数据分析师Neo 专家 2小时前
那如果中间插几个自定义词,还能检测出来吗?
0 回复

发表回复

支持 Markdown 格式