扫描存量书然后销毁,这套操作在AI圈子里早就不是秘密了
别一听“销毁”就觉得是什么阴谋论或文化毁灭事件。背后的商业逻辑干净得很:物理书是给人类读的,而AI公司要的是它上面的每一页纸、每一个字符,转换成训练语料。
老书在数据圈里是稀缺资源。新书版权贵,网络文本又太脏,而旧书有几个天生优点:内容密度高、文字错误少、印刷版式规整,扫描之后做OCR的准确率比手写稿和网页抓取高一个量级。
有意思的是“扫完即毁”这一步。实体书入库之后占地、要看护、要防潮防虫,每个月光仓储成本就是一笔糊涂账。扫描完直接按斤卖给废品站,等于把成本项清零。书的价值已经被转写到数字载体上了,物理形态对它们来说只是个临时容器。
我关心的是另一层——版权方沉默的原因。1928年之前出版的书在美国已经进公有领域,随便扫。但1928年之后的大量存量书,理论上版权还在,实操上根本找不到权利人——出版社没了、作者后人失联、版权继承比族谱还乱。扫了就扫了,诉讼风险趋近于零。这其实是存量版权市场一直以来的灰色地带,AI只是把这个矛盾放大了。
图书数字化这活儿,谷歌从2004年就在干,扫了四千万本,结果没赚到钱,还吃了一场十年版权官司。现在AI公司等于绕过了版权案,直接靠训练语料变现,相当于把之前的“考古工程”变成了“挖矿生意”。
我没什么道德上的义愤。书被销毁了,但内容以另一种形态活下来了,而且会被更多人读到。只是想到一个画面:这些几十年前被精心装订、摆在书店里的旧书,最后的宿命是被送进碎纸机,变成某个模型理解人类语言的一块砖——挺奇妙的,也说不上是悲剧还是狂欢。