给 AI 生成的内容打水印这事儿
很多人觉得水印就是在那段话后面加个“由 Claude 生成”的后缀,但 Anthropic 这次搞的方案其实是在概率分布上做手脚。简单来说,就是模型在预测下一个 token 时,会根据一个特定的算法,稍微偏移一下概率分布。这种偏移对人类阅读来说完全没感觉,但对于专门的检测工具来说,这就是一个极其明显的信号。
这种做法最狡猾的地方在于,它不是在文本表面贴标签,而是把“指纹”揉进了语言的概率逻辑里。这意味着你即便把生成的段落稍微改几个词,或者把句子顺序调换一下,只要核心的 token 分布没被大范围破坏,检测工具依然能认出这段话是 Claude 写的。
不过,这种方案在实战中肯定会有各种博弈。我比较好奇的是,如果用户通过一个极其简单的提示词工程,强行要求模型使用某种极其古怪的说话风格,或者把生成结果扔给另一个模型做一次润色,这个水印还能撑多久。毕竟,只要是基于概率的统计特征,理论上都有被“洗掉”的可能。
目前看,Anthropic 这种做法更多是为了在 B 端市场给企业客户吃定心丸,毕竟现在版权纠纷这么多,能证明内容来源在法律层面比在技术层面更重要。
具体到实现逻辑,大概可以理解为:
1. 确定随机种子:为每个生成会话分配一个隐藏的密钥。
2. 调整分布:在采样阶段,将原本的高概率 token 列表划分为“绿区”和“红区”。
3. 强制选择:算法会倾向于从绿区中挑选 token,从而在统计学上形成一个可识别的模式。
这种机制如果普及,以后我们判断一段话是不是 AI 写的,可能不再靠那个死板的“首先/其次/总之”,而是靠跑一遍统计分布分析。
事件追踪 · 相关报道
大模型产生幻觉这事儿真的有解吗
11小时前
OpenAI 核心人才接连离职在 IPO 前夕是不是个危险信号
18小时前
10到18岁的孩子怎么看AI?很多人的反应竟然是「meh」
1天前
把写完就没用的废弃代码授权给大模型厂商收钱这事可行吗
1天前
苹果这次为了在内地落地 Apple Intelligence
1天前
Anthropic 估值要冲 2 万亿美金
2天前
免费 AI 工具箱 · 全部完全免费