二手书店被莫名其妙的批量订单刷屏其实是在给大模型喂数据
英国和爱尔兰不少二手书商最近发现个怪事,很多订单量大得离谱且毫无逻辑,买家行为像极了某种自动化脚本。这种现象其实揭露了一个挺残酷的现实:当数字化版权墙越来越高,AI 公司为了给模型搞高质量语料,开始绕道去抢实体书的数字化资源。
下一篇
用正弦函数替换 B-spline 之后 →
说白了就是很多大模型公司在通过第三方代理,大规模买断那些没被数字化、或者版权模糊的旧书,然后通过 OCR 扫描成文本喂给模型。这导致很多稀缺的二手书在市场上突然消失,价格被无端抬高,对真正爱书的人来说简直是灾难。
如果这种趋势继续,以后我们可能得面对一个很诡异的局面——书店里没书,但 AI 知道书里所有的字。这本质上是一种“数据掠夺”,把实体世界的文化资产强行转化为数字算力。
我觉得这种操作挺粗暴的,而且完全没有透明度。如果 AI 公司想搞大规模语料采集,最好的实操方案应该是建立一个公开的数字化捐赠或采购协议,而不是通过这种像“刷单”一样的地下方式去扰乱二手书市场。
对于我们这些搞技术的人来说,这其实也提醒了一件事:高质量的私域数据才是未来的核心竞争力。当公开网页被爬光之后,这种从物理世界挖掘数据的“土办法”可能会成为常态。
免费 AI 工具箱 · 全部完全免费