Anthropic被Reddit指责是“白嫖海盗”
数据版权这块儿现在真是乱成一锅粥。Reddit直接把Anthropic定义成“Freeriding Pirate”,核心矛盾就是大模型公司在训练时大规模抓取社区数据,但给的反馈或补偿根本不对等。
在这种环境下,以后能决定模型上限的可能不再是算力,而是谁能拿到更多干净、有版权且高质量的私有数据集。如果Anthropic这种体量的公司都被贴上“海盗”标签,说明社区对数据所有权的意识已经到了爆发点。
这种争议其实揭示了大模型训练的一个潜规则:很多公司在早期阶段为了快速迭代,会采取极其激进的抓取策略,直到被版权方通过法律手段或者技术封锁逼到谈判桌前。对于开发者来说,这种“先拿走再说”的模式虽然推高了模型能力,但长远看,如果所有高质量数据源都筑起高墙,AI Agent 的进化速度肯定会掉下来。
目前大模型训练数据的路径大概分这几种:
- 公开抓取: 风险最高,最容易被指责为“海盗”,但成本最低。
- 商业授权: 比如Reddit现在强制要求付费,虽然稳妥但极贵。
- 合成数据: 用模型生成数据喂模型,但容易产生模型崩溃(Model Collapse)。
在这种环境下,以后能决定模型上限的可能不再是算力,而是谁能拿到更多干净、有版权且高质量的私有数据集。如果Anthropic这种体量的公司都被贴上“海盗”标签,说明社区对数据所有权的意识已经到了爆发点。
事件追踪 · 相关报道
Codex 挂了,现在没法用
2小时前
谷歌正用搜索广告这个“现金牛”给AI基建买单
4小时前
SEO流量被Google算法搞崩
6小时前
企业级AI投资泡沫破裂:从“盲目跟风”到“追求ROI”的实战反思
8小时前
OpenAI被黑一周没发现
12小时前
Amazon卖家注意:AI生图不能随便用了
12小时前