微软高管在法庭文件中承认 AI 抓取数据是人类历史上最大规模的劳动窃取
最近在 PromptCube 社区里,大家都在讨论大模型的训练集版权问题,但这次我刷到了一个极其劲爆的细节。通常情况下,像微软、OpenAI 这种体量的巨头,在面对版权诉讼时,公关稿写得那叫一个滴水不漏,永远在强调“合理使用(Fair Use)”或者“技术创新”。但这次情况变了,在纽约时报起诉相关公司的法律简报里,这些公司在法庭文件中的措辞简直可以用“自揭伤疤”来形容。
最让我震惊的是,微软的一位主管在法律文件中,竟然把 AI 抓取数据的行为定性为“人类历史上最大规模的劳动窃取”。而且,OpenAI 的负责人也在这份简报中表达了类似的危机感,他直接将 ChatGPT 描述为对出版商的一种“生存威胁(existential threat)”。
我想跟大家深入剖析一下,为什么这次的定性如此之深,以及这对我们这些在 AI 圈子里打滚的开发者和创作者意味着什么。
法律文件 vs 公关稿:这次他们说的是真话
首先,我们要区分一个概念:公关稿是为了让股价上涨和用户买单,而法律简报(Legal Briefs)是为了在法庭上博弈。在法庭文件里,为了在特定的法律逻辑下争取某种辩护空间,或者在承认部分事实的基础上寻求折中方案,公司有时会说出一些在新闻发布会上绝对不敢说的实话。
这次微软的一位 director 明确使用了 “the largest theft of labor in human history” 这个极其激进的说法。请注意,这里用的是 “theft of labor”(劳动窃取),而不是简单的 “data collection”(数据采集)。这意味着在法律博弈的深水区,微软内部其实已经意识到,这种大规模、无差别地抓取全网数据来喂养模型,在某种程度上确实是对全球创作者劳动的剥夺。
与此同时,OpenAI 负责人的表述也同样激进。他把 ChatGPT 对出版商的影响定义为 “an existential threat”,也就是一种生存威胁。大家想想,一个公司在被起诉时,竟然承认自己的产品是对对方的“生存威胁”,这在商业逻辑上是非常罕见的。通常他们会说“我们是在赋能出版商”,但这次他们承认了这种冲击是毁灭性的。
这种定性之所以重要,是因为它把 AI 训练的本质从“技术进步”拉回到了“资源分配”和“权益归属”的问题上。
这种定性对开发者和创作者意味着什么?
很多小伙伴可能会觉得,这不过是大公司在打官司时的措辞技巧,跟我们写 Prompt、调参数有什么关系?其实关系大了。
从技术实现的角度来看,抓取(scraping)确实是所有大模型训练的基石。没有海量的网页数据,就没有现在的 GPT-4 或 Claude。但现在法律层面开始给这个行为“贴标签”了。如果这种行为在法律上被正式定义为 “theft of labor”,那么整个 AI 行业的底层逻辑可能都要重构。
我们可以从以下三个维度来看看潜在的影响:
1. 训练成本的指数级增长
目前绝大多数的开源项目或中小模型,依然依赖于公开的 Common Crawl 等数据集。但如果未来法律强制要求为每一条抓取的数据付费,或者需要获得明确的授权,那么训练成本将不再仅仅是算力成本,而会增加极其恐怖的数据采购成本。这意味着,训练成本将呈指数级增长,只有极少数超级巨头才玩得起这种游戏。
2. 中小模型项目的潜在风险
这次定性可能会引发连锁反应,导致更多版权诉讼。最危险的可能不是微软这种有钱赔的公司,而是那些没有明确授权就使用数据的中小模型项目。如果“抓取即窃取”成为法律共识,很多基于公开数据集微调的模型可能会面临法律追溯,导致项目被迫下线或支付巨额赔偿。
3. 行业趋势的剧烈转向
这是一个非常明确的信号:单纯靠抓取数据的“野蛮生长”阶段可能快要结束了。未来的趋势必然会转向“有偿授权的商业协议”。我们可以预见,未来会出现更多像 OpenAI 与各大媒体达成协议那样的数据买卖合同。数据将从一种“随处可见的资源”变成一种“昂贵的资产”。
面对这种争议,我们作为从业者该怎么看待?
虽然法律文件里的措辞听起来很犀利,甚至有点像在“认罪”,但我认为这其实是对创作者的一种正向激励。
长期以来,AI 行业一直处于一种“先抢占,后补票”的状态。如果 AI 能够通过正规的商业渠道,将利润回馈给数据的生产者(作家、记者、艺术家、程序员),整个生态才会变得更健康。毕竟,如果创作者因为 AI 的替代而全部失业,那么未来 AI 训练的数据源将会枯竭,最终导致模型陷入“模型崩溃(Model Collapse)”的死循环。
对于我们这些开发者来说,这次事件给了我们一个很重要的提醒:在构建 RAG(检索增强生成)系统或者进行模型微调时,千万不要掉以轻心。
我建议大家在设计之初就考虑数据来源的合规性。尽量使用有明确授权的数据源,或者在架构设计上就预留好数据来源的溯源机制。如果你现在还在用一些来源不明的“洗数据集”版本,建议尽快评估一下风险。规避掉这些潜在的法律坑位,比在项目上线后被发律师函要重要得多。
总结
虽然目前看来,这种法律争端还在拉锯阶段,双方都在通过各种措辞进行试探,但一个事实已经摆在面前:这种级别的公司在法庭上承认抓取数据具有如此巨大的冲击性,说明行业内部已经达成共识——不能永远依赖免费的抓取。
从 “抓取数据” → “劳动窃取” → “生存威胁”,这个逻辑链条揭示了 AI 产业正在进入一个从“技术驱动”转向“权益驱动”的深水区。对于我们来说,关注这些法律动态,比关注某个新版本的 API 更新可能更重要,因为这决定了未来 AI 产品的生存土壤。
这不就是典型的睁眼说瞎话?那 Common Crawl 这种开源数据集是怎么回事。