OpenAI 和微软这次又被西雅图时报和 Newsday 给告了

老阿伟的日常 初级 1小时前 537 浏览 10 点赞 约 2 分钟

版权这块儿 OpenAI 真是捅了马蜂窝,这次又是西雅图时报(Seattle Times)和 Newsday 联手把 OpenAI 和微软给告了。其实这种案子现在已经成了某种“模版”,基本逻辑都一样:指责 OpenAI 在没给钱、没授权的情况下,直接把人家的深度报道拿去喂模型,而且最让媒体破防的是,模型在回答用户问题时,有时候直接把原话给“吐”出来了,这在法律上就成了典型的侵权证据。

OpenAI 和微软这次又被西雅图时报和 Newsday 给告了

这次有趣的地方在于,微软也被拉进了被告席。毕竟 Copilot 底层跑的全是 OpenAI 的东西,微软想通过投资和深度集成来分蛋糕,结果现在得帮着一起扛官司。而且这次不是两家小报在闹,据说是跟在后面的地方报纸规模很大,差不多有 400 家当地报社都在这次诉讼的阵营里。

我之前在测试 GPT-4o 的时候确实发现过一个现象,如果你问一些非常冷门的本地新闻,它有时候给出的措辞跟某些特定媒体的报道惊人地一致。这其实就是所谓的“记忆效应”(Memorization),模型在训练阶段如果某个片段出现次数过多,或者权重过高,它就没把信息“内化”,而是直接把原句给背下来了。对于开发者来说,这其实是 RAG(检索增强生成)要解决的问题,但对于媒体来说,这就是在偷内容。

其实这种版权纠纷现在已经成了 AI 行业的常态。之前纽约时报(The New York Times)、Ziff Davis 甚至像大英百科全书(Encyclopedia Britannica)这种老牌机构都起诉过了。现在看来,OpenAI 走的是一种“先抢跑,后赔钱”的策略。它默认所有公开可见的网页数据都可以用来训练,但法律层面对“合理使用”(Fair Use)的定义在 AI 时代还没定论。

我个人觉得,这种诉讼其实是在逼 OpenAI 建立一套更透明的付费机制。现在的趋势是,大模型公司开始跟个别媒体签独家协议,比如给钱买数据,或者在引用时给一个非常明显的来源链接。但对于那些规模较小的本地报社来说,它们没有议价能力,只能通过集体诉讼来争取一点存在感。

如果以后所有的训练数据都要付费,那模型的成本会飙升,而且可能会导致数据垄断——只有买得起数据的公司才能训练出强模型,这反而不利于 AI 的民主化。不过目前的现状是,只要法律没给出明确的判定,OpenAI 估计还会继续这么跑。

对于咱们用模型的人来说,最直接的影响可能就是未来某些特定领域的回答会变得更“保守”,或者在引用来源时变得极其啰嗦,因为它们必须在法律安全区内运行。

openai求助MicrosoftSeattle TimesNewsday

全部回复 (4)

脚本小子阿强 初级 1小时前
其实很多媒体现在都开始在robots.txt里禁爬了,但效果一般。
0 回复
调参侠小美 初级 1小时前
毕竟很多爬虫根本不看那个文件,你觉得现在还有用吗?
0 回复
养生全栈 中级 1小时前
那现在如果模型直接原话输出了,怎么证明它是背诵而不是实时检索?
0 回复
大Jerry 高级 1小时前
我之前用GPT搜过冷门资料,确实出现过大段原话,像复制粘贴一样。
0 回复

发表回复

支持 Markdown 格式