AI公司因避免模型塌缩,疯狂抢购未被AI污染的2022年前出版的人类原创旧书做训练语料,人类高质量文本或将耗尽,AI可能再次陷入发展停滞期。 ## **1. 互联网内容已被AI深度渗透** 2025年互联网新产生内容中AI生成占比超一半,全球网站访问请求中AI、爬虫占比也超一半,人类访问占比成少数。 ## **2. 旧书因避免模型塌缩更抢手** AI反复用AI生成内容训练会引发模型塌缩,造成输出质量断崖式下降,2022年前出版旧书全为人类原创内容,未被AI污染因此价格更高。 ## **3. 高质量人类文本预计很快耗尽** 按当前消耗速度测算,公开可获取的高质量人类文本预计会在2026-2032年间被基本耗尽,目前学界和产业界尚未找到有效替代方案。 ## **4. AI公司合法购书销毁扫描获法院支持** AI公司批量收购冷门高文献价值旧书,拆书扫描后销毁纸质原件,若购书合法,该行为被美国法院认定为合理使用,而下载盗版训练会被判天价赔偿。 ## **5. AI领域可能再次进入发展停滞期** 当前算法、算力瓶颈已被突破,但人类高质量文本耗尽后数据将成为新卡脖子要素,现有新技术仅能延缓模型塌缩,无法解决根本问题,AI可能再次进入停滞期。
全球AI公司,疯狂抢购旧书
2026-08-03 08:42

全球AI公司,疯狂抢购旧书

本文来自微信公众号: 技术领导力 ,作者:Mr.K


数据中间商ISBNdb最近很忙,忙着接AI公司的大单。


这家公司原本服务图书馆和书商,手握超过1.11亿本图书的目录信息,现在业务重心已经悄悄转向AI行业,把旧书批发给各家AI公司。



这些AI公司买家拿到书之后,用液压切割机把书脊切掉,散开的纸页送进高速扫描仪,变成清晰的PDF文件,扫完之后纸质原件直接送去销毁。书本的内容用于模型训练。


有意思的是,2022年之前出版的旧书更抢手,价格也开得更高。这背后的逻辑,我们下边会聊。


这种操作,也不是第一次被曝出来。Anthropic在这方面算是老手了,公司内部代号“巴拿马计划”的项目,就累计处理过两百万册实体书。


01


互联网已经被AI污染


行业机构的最新统计显示,2025年之后,互联网上新产生的内容里,AI生成的比例已经超过一半,而2022年ChatGPT刚发布的时候,这个比例几乎是零。短短几年时间,互联网的内容生态已经发生了根本性的变化。



流量方面,有安全服务商监测到,全球网站访问请求里,来自AI或者各类爬虫的占比已经超过一半,人类真正手动访问的请求反倒成了少数。换句话说,现在的互联网,更多时候是AI在跟AI说话,人类成了旁观者。


需要说的是,AI生成内容本身没什么问题,恰恰相反,AI正在帮许多专业人士把创作效率和质量,进行大幅提升。


问题出在模型训练,这些AI生成的内容一旦用来训练下一代AI模型,就会导致模型质量大幅下降。


02


模型训练的“吞尾效应”


业内把这个现象叫做“模型塌缩”,说的是当AI模型反复用AI生成的内容来训练自己,输出质量就会断崖式下降。



原理不复杂,人类写东西的时候,会有各种意外的表达、独特的用词、真实世界里发生过的具体细节,这些东西信息量很大。AI生成的内容往往是对已有模式的重新组合,本身就带着一层信息损耗。让AI去学习AI生成的东西,相当于复印机反复复印同一张纸,复印的次数越多,画面越模糊,细节越丢失。


这也解释了2022年以前出版的旧书为什么值钱。因为,2022年之前出版的书,内容100%是人类手写的,没有被污染过。2022年之后出版的书就不一样了,AI辅助写作甚至AI代笔的比例不断攀升。


那现在AI能用的高质量人类语料,到底还剩多少?有测算机构给出的预估是,按照目前的消耗速度,语言模型会在2026到2032年之间,把网络上能公开获取的高质量人类文本资源基本耗尽。留给AI行业的时间窗口,其实已经已经不多了。


而且,目前学界和产业界都没找到真正有效的替代方案。


03


旧书争夺战,不断升级


回到开头说的ISBNdb。这家公司现在提供的采购套餐从一千本到一百万本都有,明码标价,走批发路线。每一笔交易都会签保密协议,买家名字永远不会被公开,这也是为什么外界一直搞不清到底哪些AI公司在买书。


被大量买走的书,大多是那种商业价值几乎为零、但文献价值很高的冷门书,地方志、小城镇史料、已经消亡学科的老专著、小语种或者土著语言的文献、自费出版的战争回忆录、印量极小的学术论文集。正因为够冷门够绝版,这类书才更容易被大批量收购、大批量销毁,市面上再也找不到第二份。


Anthropic的巴拿马计划,负责操盘的是汤姆·特维,一个在Google Books项目里就干过同样事情的硅谷老兵。根据他的描述,整套流程走的是标准化产线:工人用液压切割机切掉书脊,散页送进生产级高速扫描仪转成PDF,扫完的纸质残骸直接打包送去回收公司处理。


为什么非要销毁纸书?答案有点反常识。2025年联邦法院对这类案件做出了判定,如果书是合法购买来的,哪怕后续拆书扫描再销毁,训练行为本身也算合理使用,因为AI训练被认定为具有变革性。也就是说,只要买书环节干净合法,法院大概率不会拦着你拆书扫描。


但是,如果你下载盗版书,情况就不一样了。Anthropic联合创始人本·曼恩,早在2021年就从盗版网站LibGen下载了至少500万本盗版电子书,2022年又从另一个盗版渠道下载了至少200万本,都是拿来训练模型用的。后来,法院判Anthropic赔偿1.5亿美元,这个天价罚金创下这个领域的赔付纪录。


不得不说,有时候老美的思路还是很清奇的。


04


AI或将再次进入漫长“停滞期”


回头看AI领域这几十年的发展,其实经历过好几段漫长的停滞期。支撑模型训练的三大要素是:算法、算力、数据。


算法这条线上,深度学习没突破之前,进展十分缓慢,直到Transformer架构被提出来,才算真正解决了算法问题。


算力方面,“摩尔定律”支撑了芯片性能的快速发展,云计算解决了大规模集群调度的问题,算力这个瓶颈也彻底解决了。


数据方面,随着互联网和移动互联网的爆发式增长,海量的高质量文本给了模型足够的训练数据。


这才有了2022年末,这轮AI技术浪潮的彻底爆发。


但是,随着人类高质量文本被消耗完毕,数据又成了卡脖子的要素,这一轮AI浪潮也将结束,AI领域很可能又会陷入另一段“停滞期”。


学界目前也在尝试新的方法,比如合成数据生成、多模态数据补充等等,但说到底,这些手段只是在延缓模型塌缩发生的速度,并没有从根本上解决这个问题。


旧书争夺战看似是行业趣闻,深究下去,却是整个人类文明积累的知识财富,正被以近乎掠夺的方式重新提炼、榨干。这早已不是几家AI公司争抢训练语料的商业博弈,而是一道关乎人类文明如何与AI共生共存的时代命题。

AI创投日报频道: 前沿科技
本内容来源于网络 原文链接,观点仅代表作者本人,不代表虎嗅立场。
如涉及版权问题请联系 hezuo@huxiu.com,我们将及时核实并处理。
正在改变与想要改变世界的人,都在 虎嗅APP