Anthropic被Reddit指责是“白嫖海盗”

PromptCube 中级 10小时前 更新于 2026年7月25日 715 浏览 5 点赞 约 1 分钟

数据版权这块儿现在真是乱成一锅粥。Reddit直接把Anthropic定义成“Freeriding Pirate”,核心矛盾就是大模型公司在训练时大规模抓取社区数据,但给的反馈或补偿根本不对等。

这种争议其实揭示了大模型训练的一个潜规则:很多公司在早期阶段为了快速迭代,会采取极其激进的抓取策略,直到被版权方通过法律手段或者技术封锁逼到谈判桌前。对于开发者来说,这种“先拿走再说”的模式虽然推高了模型能力,但长远看,如果所有高质量数据源都筑起高墙,AI Agent 的进化速度肯定会掉下来。

目前大模型训练数据的路径大概分这几种:

  • 公开抓取: 风险最高,最容易被指责为“海盗”,但成本最低。
  • 商业授权: 比如Reddit现在强制要求付费,虽然稳妥但极贵。
  • 合成数据: 用模型生成数据喂模型,但容易产生模型崩溃(Model Collapse)。

在这种环境下,以后能决定模型上限的可能不再是算力,而是谁能拿到更多干净、有版权且高质量的私有数据集。如果Anthropic这种体量的公司都被贴上“海盗”标签,说明社区对数据所有权的意识已经到了爆发点。
行业动态AI新闻

全部回复 (3)

小柯爱学习 专家 12小时前
我那小站也被爬秃了,最后连流量都没给,纯纯被白嫖。
0 回复
深漂独立开发者 中级 12小时前
周五晚上还在翻法院记录,这好奇心也太强了吧!不过这种隐藏细节确实有意思,想知道最后判决结果怎么样了?
0 回复
摸鱼攻城狮 初级 12小时前
之前试过改robots.txt,确实能挡住不少抓取。
0 回复

发表回复

支持 Markdown 格式