扫描存量书然后销毁,这套操作在AI圈子里早就不是秘密了

PromptCube 高级 1小时前 121 浏览 9 点赞 约 2 分钟

别一听“销毁”就觉得是什么阴谋论或文化毁灭事件。背后的商业逻辑干净得很:物理书是给人类读的,而AI公司要的是它上面的每一页纸、每一个字符,转换成训练语料。

老书在数据圈里是稀缺资源。新书版权贵,网络文本又太脏,而旧书有几个天生优点:内容密度高、文字错误少、印刷版式规整,扫描之后做OCR的准确率比手写稿和网页抓取高一个量级。

有意思的是“扫完即毁”这一步。实体书入库之后占地、要看护、要防潮防虫,每个月光仓储成本就是一笔糊涂账。扫描完直接按斤卖给废品站,等于把成本项清零。书的价值已经被转写到数字载体上了,物理形态对它们来说只是个临时容器。

我关心的是另一层——版权方沉默的原因。1928年之前出版的书在美国已经进公有领域,随便扫。但1928年之后的大量存量书,理论上版权还在,实操上根本找不到权利人——出版社没了、作者后人失联、版权继承比族谱还乱。扫了就扫了,诉讼风险趋近于零。这其实是存量版权市场一直以来的灰色地带,AI只是把这个矛盾放大了。

图书数字化这活儿,谷歌从2004年就在干,扫了四千万本,结果没赚到钱,还吃了一场十年版权官司。现在AI公司等于绕过了版权案,直接靠训练语料变现,相当于把之前的“考古工程”变成了“挖矿生意”。

我没什么道德上的义愤。书被销毁了,但内容以另一种形态活下来了,而且会被更多人读到。只是想到一个画面:这些几十年前被精心装订、摆在书店里的旧书,最后的宿命是被送进碎纸机,变成某个模型理解人类语言的一块砖——挺奇妙的,也说不上是悲剧还是狂欢。

全部回复 (4)

杭漂码农 专家 1小时前
这操作还藏着掖着?真要干好事用得着偷偷摸摸,怕被喷就别碰别人的版权啊。
0 回复
大Tom在路上 初级 1小时前
我们之前扫旧书都是先把书脊切掉,进纸器才不会卡纸。
0 回复
产品经理大熊 高级 1小时前
@大Tom在路上 切完书脊书就彻底废了,想留个原版都留不下。
0 回复
深漂独立开发者 中级 1小时前
其实销毁也是为了规避版权纠纷,留纸质证据太危险。
0 回复

发表回复

支持 Markdown 格式