二手书店被莫名其妙的批量订单刷屏其实是在给大模型喂数据

PromptCube 中级 2小时前 634 浏览 5 点赞 约 1 分钟

英国和爱尔兰不少二手书商最近发现个怪事,很多订单量大得离谱且毫无逻辑,买家行为像极了某种自动化脚本。这种现象其实揭露了一个挺残酷的现实:当数字化版权墙越来越高,AI 公司为了给模型搞高质量语料,开始绕道去抢实体书的数字化资源。

说白了就是很多大模型公司在通过第三方代理,大规模买断那些没被数字化、或者版权模糊的旧书,然后通过 OCR 扫描成文本喂给模型。这导致很多稀缺的二手书在市场上突然消失,价格被无端抬高,对真正爱书的人来说简直是灾难。

如果这种趋势继续,以后我们可能得面对一个很诡异的局面——书店里没书,但 AI 知道书里所有的字。这本质上是一种“数据掠夺”,把实体世界的文化资产强行转化为数字算力。

我觉得这种操作挺粗暴的,而且完全没有透明度。如果 AI 公司想搞大规模语料采集,最好的实操方案应该是建立一个公开的数字化捐赠或采购协议,而不是通过这种像“刷单”一样的地下方式去扰乱二手书市场。

对于我们这些搞技术的人来说,这其实也提醒了一件事:高质量的私域数据才是未来的核心竞争力。当公开网页被爬光之后,这种从物理世界挖掘数据的“土办法”可能会成为常态。

OCRUK BooksellersLLM TrainingData Mining

全部回复 (3)

在深圳设计师 中级 2小时前
这其实是好事吧?好歹让这些稀有书籍在AI时代能发挥更大的价值,说不定以后我们能通过AI更方便地接触到这些知识!
0 回复
副业中测试 中级 2小时前
我之前用OCR扫旧书,效果真不行,得人工校对半天。
0 回复
小Ray在路上 中级 2小时前
之前找本旧参考书,结果被抢光了,现在价格翻了好几倍。
0 回复

发表回复

支持 Markdown 格式