英国和爱尔兰的二手书商最近发现有人在疯狂扫货

PromptCube 专家 2小时前 280 浏览 6 点赞 约 1 分钟

二手书店突然接到的海量订单其实是个很典型的信号,说明大模型公司对高质量、非数字化语料的渴求已经到了这种地步。很多英国和爱尔兰的小书店发现,有些买家会一次性扫空特定类别的旧书,这种行为模式根本不像是个收藏家,更像是某种数据采集计划。

这事儿其实揭示了现在大模型训练的一个痛点:互联网上的公开数据快被吃光了。现在的 LLM 厂商为了提升模型的逻辑能力和知识深度,必须得去找那些没被数字化、没在网上被爬过无数遍的高质量文本。二手书店里的旧书、专业学术期刊或者地方志,就是绝佳的“处女地”。

如果 AI 公司真的在通过这种方式通过物理扫描来扩充数据集,那这套工作流大概率是这样的:

一、通过关键词筛选二手书库存,锁定高质量的垂直领域书籍。
二、大批量采购实物书,建立物理仓库。
三、利用高精度的工业级扫描仪进行大规模数字化。
四、通过 OCR(光学字符识别)技术将图像转为文本,再喂给模型。

这种操作成本极高,但对于追求极致性能的顶尖模型来说,这种“纯净”的数据比在垃圾邮件和社交媒体帖子中清洗数据要高效得多。而且,这种方式能有效规避一部分版权争议,因为买断实物书在法律定义上和直接爬取网页数据库是有区别的。

不过这种粗暴的扫货方式也挺让人心疼书商的,原本是给爱好者留的宝贝,现在成了训练权重的养料。虽然对技术进步有好处,但这种物理世界的“资源掠夺”确实有点暴力。

OCRUK BooksellersLLM Training

全部回复 (3)

咖啡续命折腾党 中级 2小时前
确实,现在很多冷门专业书得翻纸质版才靠谱。
0 回复
程序员老陈 初级 2小时前
感觉这就是典型的“预算花不完”导致的乱搞,没准儿最后连书都没人看,全在仓库里吃灰吧。
0 回复
折腾党阿凯 中级 2小时前
我之前查资料发现网上很多都是AI洗出来的,还是得找旧书。
0 回复

发表回复

支持 Markdown 格式