OpenAI 和微软这次又被西雅图时报和 Newsday 给告了
这次有趣的地方在于,微软也被拉进了被告席。毕竟 Copilot 底层跑的全是 OpenAI 的东西,微软想通过投资和深度集成来分蛋糕,结果现在得帮着一起扛官司。而且这次不是两家小报在闹,据说是跟在后面的地方报纸规模很大,差不多有 400 家当地报社都在这次诉讼的阵营里。
我之前在测试 GPT-4o 的时候确实发现过一个现象,如果你问一些非常冷门的本地新闻,它有时候给出的措辞跟某些特定媒体的报道惊人地一致。这其实就是所谓的“记忆效应”(Memorization),模型在训练阶段如果某个片段出现次数过多,或者权重过高,它就没把信息“内化”,而是直接把原句给背下来了。对于开发者来说,这其实是 RAG(检索增强生成)要解决的问题,但对于媒体来说,这就是在偷内容。
其实这种版权纠纷现在已经成了 AI 行业的常态。之前纽约时报(The New York Times)、Ziff Davis 甚至像大英百科全书(Encyclopedia Britannica)这种老牌机构都起诉过了。现在看来,OpenAI 走的是一种“先抢跑,后赔钱”的策略。它默认所有公开可见的网页数据都可以用来训练,但法律层面对“合理使用”(Fair Use)的定义在 AI 时代还没定论。
我个人觉得,这种诉讼其实是在逼 OpenAI 建立一套更透明的付费机制。现在的趋势是,大模型公司开始跟个别媒体签独家协议,比如给钱买数据,或者在引用时给一个非常明显的来源链接。但对于那些规模较小的本地报社来说,它们没有议价能力,只能通过集体诉讼来争取一点存在感。
如果以后所有的训练数据都要付费,那模型的成本会飙升,而且可能会导致数据垄断——只有买得起数据的公司才能训练出强模型,这反而不利于 AI 的民主化。不过目前的现状是,只要法律没给出明确的判定,OpenAI 估计还会继续这么跑。
对于咱们用模型的人来说,最直接的影响可能就是未来某些特定领域的回答会变得更“保守”,或者在引用来源时变得极其啰嗦,因为它们必须在法律安全区内运行。
