本文来自微信公众号: 技术领导力 ,作者:Mr.K
数据中间商ISBNdb最近很忙,忙着接AI公司的大单。
这家公司原本服务图书馆和书商,手握超过1.11亿本图书的目录信息,现在业务重心已经悄悄转向AI行业,把旧书批发给各家AI公司。

这些AI公司买家拿到书之后,用液压切割机把书脊切掉,散开的纸页送进高速扫描仪,变成清晰的PDF文件,扫完之后纸质原件直接送去销毁。书本的内容用于模型训练。
有意思的是,2022年之前出版的旧书更抢手,价格也开得更高。这背后的逻辑,我们下边会聊。
这种操作,也不是第一次被曝出来。Anthropic在这方面算是老手了,公司内部代号“巴拿马计划”的项目,就累计处理过两百万册实体书。
01
互联网已经被AI污染
行业机构的最新统计显示,2025年之后,互联网上新产生的内容里,AI生成的比例已经超过一半,而2022年ChatGPT刚发布的时候,这个比例几乎是零。短短几年时间,互联网的内容生态已经发生了根本性的变化。

流量方面,有安全服务商监测到,全球网站访问请求里,来自AI或者各类爬虫的占比已经超过一半,人类真正手动访问的请求反倒成了少数。换句话说,现在的互联网,更多时候是AI在跟AI说话,人类成了旁观者。
需要说的是,AI生成内容本身没什么问题,恰恰相反,AI正在帮许多专业人士把创作效率和质量,进行大幅提升。
问题出在模型训练,这些AI生成的内容一旦用来训练下一代AI模型,就会导致模型质量大幅下降。
02
模型训练的“吞尾效应”
业内把这个现象叫做“模型塌缩”,说的是当AI模型反复用AI生成的内容来训练自己,输出质量就会断崖式下降。

原理不复杂,人类写东西的时候,会有各种意外的表达、独特的用词、真实世界里发生过的具体细节,这些东西信息量很大。AI生成的内容往往是对已有模式的重新组合,本身就带着一层信息损耗。让AI去学习AI生成的东西,相当于复印机反复复印同一张纸,复印的次数越多,画面越模糊,细节越丢失。
这也解释了2022年以前出版的旧书为什么值钱。因为,2022年之前出版的书,内容100%是人类手写的,没有被污染过。2022年之后出版的书就不一样了,AI辅助写作甚至AI代笔的比例不断攀升。
那现在AI能用的高质量人类语料,到底还剩多少?有测算机构给出的预估是,按照目前的消耗速度,语言模型会在2026到2032年之间,把网络上能公开获取的高质量人类文本资源基本耗尽。留给AI行业的时间窗口,其实已经已经不多了。
而且,目前学界和产业界都没找到真正有效的替代方案。
03
旧书争夺战,不断升级
回到开头说的ISBNdb。这家公司现在提供的采购套餐从一千本到一百万本都有,明码标价,走批发路线。每一笔交易都会签保密协议,买家名字永远不会被公开,这也是为什么外界一直搞不清到底哪些AI公司在买书。
被大量买走的书,大多是那种商业价值几乎为零、但文献价值很高的冷门书,地方志、小城镇史料、已经消亡学科的老专著、小语种或者土著语言的文献、自费出版的战争回忆录、印量极小的学术论文集。正因为够冷门够绝版,这类书才更容易被大批量收购、大批量销毁,市面上再也找不到第二份。
Anthropic的巴拿马计划,负责操盘的是汤姆·特维,一个在Google Books项目里就干过同样事情的硅谷老兵。根据他的描述,整套流程走的是标准化产线:工人用液压切割机切掉书脊,散页送进生产级高速扫描仪转成PDF,扫完的纸质残骸直接打包送去回收公司处理。
为什么非要销毁纸书?答案有点反常识。2025年联邦法院对这类案件做出了判定,如果书是合法购买来的,哪怕后续拆书扫描再销毁,训练行为本身也算合理使用,因为AI训练被认定为具有变革性。也就是说,只要买书环节干净合法,法院大概率不会拦着你拆书扫描。
但是,如果你下载盗版书,情况就不一样了。Anthropic联合创始人本·曼恩,早在2021年就从盗版网站LibGen下载了至少500万本盗版电子书,2022年又从另一个盗版渠道下载了至少200万本,都是拿来训练模型用的。后来,法院判Anthropic赔偿1.5亿美元,这个天价罚金创下这个领域的赔付纪录。
不得不说,有时候老美的思路还是很清奇的。
04
AI或将再次进入漫长“停滞期”
回头看AI领域这几十年的发展,其实经历过好几段漫长的停滞期。支撑模型训练的三大要素是:算法、算力、数据。
算法这条线上,深度学习没突破之前,进展十分缓慢,直到Transformer架构被提出来,才算真正解决了算法问题。
算力方面,“摩尔定律”支撑了芯片性能的快速发展,云计算解决了大规模集群调度的问题,算力这个瓶颈也彻底解决了。
数据方面,随着互联网和移动互联网的爆发式增长,海量的高质量文本给了模型足够的训练数据。
这才有了2022年末,这轮AI技术浪潮的彻底爆发。
但是,随着人类高质量文本被消耗完毕,数据又成了卡脖子的要素,这一轮AI浪潮也将结束,AI领域很可能又会陷入另一段“停滞期”。
学界目前也在尝试新的方法,比如合成数据生成、多模态数据补充等等,但说到底,这些手段只是在延缓模型塌缩发生的速度,并没有从根本上解决这个问题。
旧书争夺战看似是行业趣闻,深究下去,却是整个人类文明积累的知识财富,正被以近乎掠夺的方式重新提炼、榨干。这早已不是几家AI公司争抢训练语料的商业博弈,而是一道关乎人类文明如何与AI共生共存的时代命题。
