英国和爱尔兰的二手书商最近发现有人在疯狂扫货
二手书店突然接到的海量订单其实是个很典型的信号,说明大模型公司对高质量、非数字化语料的渴求已经到了这种地步。很多英国和爱尔兰的小书店发现,有些买家会一次性扫空特定类别的旧书,这种行为模式根本不像是个收藏家,更像是某种数据采集计划。
这事儿其实揭示了现在大模型训练的一个痛点:互联网上的公开数据快被吃光了。现在的 LLM 厂商为了提升模型的逻辑能力和知识深度,必须得去找那些没被数字化、没在网上被爬过无数遍的高质量文本。二手书店里的旧书、专业学术期刊或者地方志,就是绝佳的“处女地”。
如果 AI 公司真的在通过这种方式通过物理扫描来扩充数据集,那这套工作流大概率是这样的:
一、通过关键词筛选二手书库存,锁定高质量的垂直领域书籍。
二、大批量采购实物书,建立物理仓库。
三、利用高精度的工业级扫描仪进行大规模数字化。
四、通过 OCR(光学字符识别)技术将图像转为文本,再喂给模型。
这种操作成本极高,但对于追求极致性能的顶尖模型来说,这种“纯净”的数据比在垃圾邮件和社交媒体帖子中清洗数据要高效得多。而且,这种方式能有效规避一部分版权争议,因为买断实物书在法律定义上和直接爬取网页数据库是有区别的。
不过这种粗暴的扫货方式也挺让人心疼书商的,原本是给爱好者留的宝贝,现在成了训练权重的养料。虽然对技术进步有好处,但这种物理世界的“资源掠夺”确实有点暴力。
事件追踪 · 相关报道
一个全球性的二手书扫货行为
9天前
免费 AI 工具箱 · 全部完全免费