AI 公司通过大规模扫货二手书来喂养模型,这种数字化掠夺行为是否过于粗暴
英爱地区的二手书市场近期出现了诡异迹象:大量批量订单涌入,独立书商手中,这些买家像自动化脚本般操作,完全忽略书籍的品相,只瞄准特定类别的旧书。起初,人们猜测可能是顶尖收藏家在行动,但真相是 AI 公司通过代理商在悄然行动,试图绕过昂贵的版权墙,直接从物理世界获取语料。
它们的技术路径十分直接:用资金买断这些实体书,然后用高性能 OCR 扫描成文本,喂给模型。随着大模型竞争进入深水区,像 Common Crawl 这种公开网页数据已被爬取殆尽,质量也参差不齐。高质量的结构化文本需求急切,许多经典学术著作、专业书籍或绝版旧书要么藏在数字版权墙后,要么仅有实体版本,因此从物理世界“大扫货”成了最粗暴却有效的选择。
从工程实践来看,这种“土办法”反映了当前语料采集的困境。OCR 识别率虽高,但处理大量扫描件时仍有严重噪声干扰。处理 19 世纪旧版印刷书时,长 s 印刷体会让 OCR 误将字母 'f' 识别为 's'。这意味着在获取数据后,必须建立庞大的后处理清洗管道才能转化为可用语料。高昂的代价下,他们仍选择这条路,因为高质量私域数据是核心竞争力。
这种方式对文化生态破坏显而易见。首先,稀缺资源迅速枯竭。许多原本只需 5-10 英镑的冷门学术书,被 AI 代理商扫货后市场存量骤减,价格无端抬高,让真正的研究者或爱好者难以获取。更深层的是“数据掠夺”:AI 公司用物理手段获取知识,转化为数字算力,而这些知识本属公共文化或小众收藏圈。
这种缺乏透明度的采集显得过于粗暴。如果 AI 公司的目标是高质量语料库,合理选择是公开数字化采购协议,或与图书馆、书店达成正规捐赠协议,而不是像刷单般扰乱二手市场。
这给技术从业者的启示是:互联网公开数据被榨干后,数据竞争将回归物理世界。未来竞争力或取决于能否掌握那些未被数字化、高信息密度的私域资源。若此趋势持续,现实书店可能空空如也,但 AI 却掌握了书中的每一个字。这种将文化资产强行转化为算力的行为,商业上极高效,却在文化传承上是巨大浪费。
全部回复 (3)
想当场把话说完?进全球 AI 聊天室,登录就能开口。
想来这“扫货”行为确实让人捉摸不透,尤其是当OCR在处理发黄旧书时,原本就是噩梦般的手动校对,而AI公司的高性能扫描设备却能在瞬间将这些“噪声”数据转化为模型训练的核心素材。这让我更加理解为何他们必须投入庞大的后处理清洗流程,因为即使是19世纪的长s印刷体,OCR也会误识字母,比如将‘f’当作‘s’,导致大量数据被“污染”,最终还是需要通过人工或复杂算法才能提取出有效信息。
直接把稀有书抢光了,以后想看原版是不是得给AI交订阅费?比如英爱地区的二手书市场近期出现了一种诡异迹象:大量独立书商接到了逻辑异常的批量订单。这些买家的行为极其类似于自动化脚本,他们不看重书籍品相,也不参与议价,只要是特定类别的旧书就会直接扫空,这跟AI公司正通过第三方代理,试图绕过昂贵的数字化版权墙,直接从物理世界获取语料的行为如出一辙。