为什么大模型公司开始在全球范围内疯狂扫货二手书
最近观察到一个很有意思的现象,一些 AI 巨头和数据公司开始在物理世界大规模收购二手书。很多人第一反应是某种情怀收藏,但从 AI 工程师的视角来看,这其实是一场极其激进的“数据资源抢夺战”。当 LLM(大语言模型)的训练进入瓶颈期,公开的网页数据几乎被“吃光”后,那些没被数字化、没被扫描进互联网的纸质书籍,成了最后一块纯净的处女地。
目前行业内最头疼的问题是“数据污染”。现在的互联网充斥着大量 AI 生成的内容,如果模型在训练时大量喂入由 AI 生成的合成数据,会出现严重的“模型崩溃”(Model Collapse)现象——模型会逐渐丢失分布的边缘,导致输出变得单一且平庸。而几十年前出版的二手书是天然的“纯净语料”,它们在 AI 时代之前就已经定稿,没有任何合成痕迹。
要把这些物理书籍转化为模型能理解的养料,背后是一套极其枯燥且昂贵的工业化链路。这绝对不是简单的拍照上传,而是一个涉及硬件扫描、OCR 识别和文本清洗的复杂流水线。我们可以模拟一下这个数字化处理的逻辑:
# 数字化处理伪代码模拟
for book in acquired_books:
# 使用工业级高速扫描仪获取高分辨率原始图像
raw_img = high_speed_scan(book)
# 通过 OCR 引擎(如 Tesseract 或自研模型)将图像转为文本
text_content = ocr_engine.process(raw_img)
# 关键步骤:去除扫描噪点、修正 OCR 误识别、剔除页眉页脚
cleaned_text = text_refiner.remove_noise(text_content)
# 将清洗后的纯净文本存入向量数据库,准备进入预训练阶段
save_to_vector_db(cleaned_text)
在这个过程中,最核心的挑战在于“噪声处理”。物理书籍在扫描过程中会产生大量噪点,如果 OCR 识别率只有 98%,那么在处理一本 50 万字的书时,依然会有 1 万个字符的错误。这些错误如果直接喂给模型,会对 Token 预测产生负面影响。因此,一个高效的 text_refiner 模块比扫描仪本身更重要。
除了避开数据污染,这种“反向数字化”行为还在挖掘深层的“冷门知识”。很多专业领域的古籍、绝版技术手册或地方志从未被数字化,这意味着它们包含的逻辑推理链条和深度专业知识,是目前公开数据集(如 Common Crawl)中完全缺失的。在模型参数量已经足够大的今天,决定模型上限的不再是数据量,而是数据的“质量”和“稀缺度”。
此外,从工程落地来看,物理购买书籍再数字化在某些法域中处于版权的灰色地带,比直接大规模爬取具有严格反爬机制的版权网站要好操作得多。
这种趋势其实挺讽刺的:我们追求最前沿的计算能力,试图构建数字智能,结果最后却得回头去翻旧书堆里找养料。这种资源垄断一旦形成,谁掌握了物理世界的文本孤岛,谁就拥有了下一代模型迭代的特权。这已经不再是单纯的代码竞争,而是一场关于物理资源占有的战争。
全部回复 (3)
想当场把话说完?进全球 AI 聊天室,登录就能开口。
扫完书怎么洗数据才是关键,要是全得靠人工剔除那效率也太低了。