用版权书喂大模型到底算不算侵权,这事儿现在真没个定论
用大模型写小说、画画,这事儿现在吵得不可开交,但最核心的矛盾其实就在于:那些正在被 AI 快速迭代的知识库,到底该不该付费?
目前的法律现状其实处于一种“真空期”或“拉锯期”。很多大模型厂商在部署训练任务时,往往是采取一种“先斩后奏”的策略,先把数据抓取过来跑起来,等版权方的诉讼打到面前时,模型已经迭代好几代了。
现在的局面挺荒谬的。绝大多数出版作家在完全不知情、也没拿到授权的情况下,他们的文字、思想甚至独特的叙事风格,已经被喂进了各种大模型的训练集里。这些模型现在能写出逻辑通顺、甚至带点文学色彩的内容,本质上是在“消化”这些作家的劳动成果。从直觉上看,这不就是典型的“拿别人的东西喂出自己的竞争对手”吗?如果这事儿发生在传统行业,可能早就打官司打到破产了。
但在法律层面上,事情变得极其复杂。目前争议的焦点在于“合理使用”(Fair Use)这一概念的界限。
- 训练过程的本质: 科技公司辩称,AI 并不是在“复制”书籍,而是在“学习”语言的统计规律和概率分布。他们认为,模型学习的是规律,而不是存储具体的文本片段。
- 转换性使用: 法律界有个观点,如果一个技术把原有素材转化成了某种全新的、具有高度创造性的东西(比如从文本变成了一个能对话的智能体),那么它可能符合“转换性使用”的标准。
- 市场替代效应: 这是作家方最有力的武器。如果 AI 生成的内容直接冲击了原作者的市场,导致读者不再购买原著,那么这种“学习”就极有可能被判定为侵权。
目前的法律现状其实处于一种“真空期”或“拉锯期”。很多大模型厂商在部署训练任务时,往往是采取一种“先斩后奏”的策略,先把数据抓取过来跑起来,等版权方的诉讼打到面前时,模型已经迭代好几代了。
如果未来法律倾向于保护版权方,我们可能会看到类似版权补偿机制的出现,或者像某些数据供应商那样,通过授权协议来获取训练数据的合法性。但这对于目前追求低成本、大规模数据扩张的 AI 开发者来说,无疑是一个巨大的成本压力。
事件追踪 · 相关报道
Twitch 默认把主播频道拿去喂 AI 这事儿得赶紧手动关掉
10天前
生成式AI就像是创意领域的吉他英雄游戏,能模拟出顶级水准但缺乏灵魂
16天前
AI设计大肠杆菌杀手:首个公开宣布的AI设计病毒实操分析
17天前
免费 AI 工具箱 · 全部完全免费