当互联网上超过一半的新内容由AI生成,AI公司发现自己正面临一个荒诞的困境——用来训练下一代模型的数据,正在被上一代模型“污染”。于是,它们把目光投向了一个古老的源头:印刷在纸上的书。

一、“巴拿马计划”:拆书、扫描、销毁的工业化流水线

这场隐秘行动的典型代表是Anthropic代号“巴拿马计划”的项目。2024年初,Anthropic聘请了前谷歌图书项目合作负责人,内部规划文件毫不掩饰地写道:“巴拿马计划代表了我们破坏性扫描世界上所有书籍的努力。”

整套流程高度标准化:通过中间商大批量收购纸质书籍,利用液压切割机切除书脊拆分书页,依靠高速工业扫描仪完成OCR文字提取;一旦文本数据入库,所有实体原版图书统一粉碎制浆,不再留存任何实物。项目配套预算达数千万美元,服务商招标文件明确要求具备半年内处理50万至200万册图书的承载能力。

这一模式并非Anthropic独有。404 Media在2026年7月的调查显示,多家AI公司正通过数据中间商ISBNdb大规模采购二手图书。单次订单从1000本到100万本不等,书商销量在数月内飙升了五倍。一本致力于帮助AI公司采购实体书的数据库公司直言:“世界上最好的AI训练数据正摆在书架上。”

二、为什么是2022年之前的旧书?

答案指向一个AI产业自己制造的问题:互联网已经被AI生成内容污染了。

斯坦福大学《2026年AI指数报告》显示,自2025年初以来,新发布的互联网内容中AI生成比例已超过51%。当AI模型用AI生成的内容继续训练时,就会发生“模型塌缩”(Model Collapse)。2024年7月,牛津大学、剑桥大学等机构的联合研究登上《自然》封面:研究者用Meta的OPT-125m模型输入一段关于14世纪教堂塔楼的维基百科文本,第一代输出还在讨论建筑,第五代跑偏到语言翻译,第九代开始热情洋溢地介绍不存在的兔子物种。

相比之下,2022年大模型浪潮之前出版的纸质书籍,拥有无可替代的优势:内容完全源自人类原创,经过编辑层层校对,信息密度高、逻辑严谨,不存在AI生成内容的干扰。ISBNdb在官方博客中直接点明:“2022年之前印刷的纸质书,在结构上保证没有受到过这种污染。仅此一点,就是巨大的优势。”

三、15亿美元和解与“合法销毁”的法律算盘

“巴拿马计划”并非Anthropic第一次因数据来源惹上官司。此前,因非法爬取700万本电子书训练模型,Anthropic与美国作家群体达成了15亿美元的和解协议,创下美国版权案件纪录。

但“买书—拆书—扫描—销毁”的新模式,在法律上找到了一个巧妙的立足点。美国联邦法院的相关裁决认为:合法购入实体图书,仅生成一份内部数字副本并销毁原件,不存在大规模复制与对外传播,可纳入版权法下的“合理使用”范畴。法官在判决中写道:“每一本购买的印刷版都被复制以节省存储空间并实现数字化的可搜索性。印刷原件被销毁了。一个取代了另一个。”

这意味着,销毁实体书反而成了AI公司的法律护身符——没有原件,就不存在“复制品被传播”的证据。

四、书架上的“饥饿游戏”

这场争夺战的影响已经超出了AI行业。冷门绝版书籍的需求量最高增长5倍。荷兰古董书商收到来自新加坡公司近3000本书的采购订单;德国、瑞士、西班牙的书商也接到大批量订单。一位专营稀有书的美国书商发现,买家只列出一份用ISBN索引的清单,从不询问品相,也不砍价。

争议也随之爆发。有评论将此举比作亚历山大图书馆的焚毁。一位荷兰书商称之为“一种野蛮行径”。更令人担忧的是规模——有分析指出,即便扫光所有书籍,也仅能满足下一代AI三分之一的训练需求。

当技术进步以损耗人类文明结晶为代价,AI产业的“饥饿游戏”才刚刚开始。