AI 训练到底是在学习还是在抄袭?聊聊 Anthropic 被告背后的版权悖论
最近关注到 Anthropic 被一群作者集体起诉,这事儿其实撕开了目前 AI 行业一个非常尴尬的真相:我们现在所谓的“模型训练”,在法律定义上其实处于一个极其模糊的灰色地带。最讽刺的地方在于,如果一个用户把受版权保护的书籍原封不动地上传到海盗湾(The Pirate Bay),这在法律上是明确的侵权;但如果一家 AI 公司把数千万篇作品抓下来喂给模型,然后通过订阅制收费,目前竟然能用“合理使用(Fair Use)”来脱身。
很多人试图给 AI 训练正名,最常见的逻辑是:海盗湾是“复制+分发”,直接抢走了原作者的市场份额;而 AI 训练是“统计学习”,它提取的是概率分布和语言模式,产出的是全新的文本,理论上并不构成对原作品的替代。听起来逻辑自洽,但如果你真正深入使用过 Claude 或 GPT-4,就会发现这个理论在现实面前非常脆弱。
这里有一个非常关键的技术细节:当提示词(Prompt)足够精准,或者通过特定的诱导技巧时,模型完全可以实现近乎逐字的复现。比如你要求它写出某本特定版权书中的某个段落,它能精准地吐出原句。在这种情况下,AI 究竟是在“学习规律”,还是把海量数据当成了一个巨大的、可检索的压缩包?如果模型能够通过权重还原出原作品,那么所谓的“统计学习”其实就成了一次极其隐蔽的、工业规模的复制行为。
更让我不能接受的是目前数据抓取的权利不对等。现在绝大多数内容创作者面对的是一种“强制性贡献”。你写一篇深度长文发布在公网,任何一个爬虫只要运行一遍 wget 或 curl 就能把它吞进数据集。即便你在网页底部写上“禁止用于 AI 训练”,目前主流的抓取工具基本都视而不见。这种单方面的拿走,在商业逻辑上其实非常霸道——AI 公司在没有支付任何版权费的情况下,利用他人的心血构建了商业护城河,然后反过来向用户收取每月 20 美元的订阅费。
有趣的是,现在的 AI 公司在法庭上辩护的逻辑,竟然和当年技术宅们捍卫海盗湾的逻辑惊人地相似:他们都主张“信息应当自由流动”。但这两者之间有一个本质的区别:海盗湾追求的是去中心化的免费分享,而 Anthropic 追求的是中心化的商业盈利。一个是在打破壁垒,一个是在利用壁垒赚钱。
我认为,目前的“合理使用”论调更多是一种临时性的法律掩护。在法院给出最终判决之前,这种模糊性给了 AI 公司极大的套利空间。但随着数据抓取协议(如 robots.txt 的升级或新的版权立法)的推进,这种“先拿走,后定义”的模式一定会走到尽头。如果 AI 训练最终被判定为侵权,那么整个行业可能需要面对一个极其昂贵的账单:为过去几年所有抓取的语料补缴版权费。
总的来说,AI 训练不应该成为版权法的法外之地。如果我们要追求真正的智能化,那么在技术进步的同时,必须给创作者留一个真正的“拒绝入口”,而不是让 AI 公司在“合理使用”的旗号下,完成一次对全人类数字资产的无偿收割。
这不就是 Linux 衍生出安卓的逻辑吗,版权之争到最后其实就是看谁能把生态盘活