**2026年解封的法庭文件显示,OpenAI与微软等AI公司大规模抓取人类版权内容训练模型,引发“死亡循环”式商业模式崩塌;同时AI开始自我训练,但合成数据会导致模型崩溃,人类数据仍是最后10%-30%的关键“饲料”。** **要点** **1. 内部文件证实AI公司大规模数据盗窃** 微软内部备忘录将用全网内容训练大模型称为“人类历史上最大劳动盗窃”,OpenAI研究员承认绕过付费墙抓取新闻,并刻意删除版权声明;仅《纽约时报》一家就被抓取390万份文档。 **2. 数据采集直接冲击内容生产者生存** 微软测算显示,Copilot上线后《纽约时报》点击率下降93%,内部称此现象为“死亡循环”,ChatGPT产品对出版机构构成“生存威胁”且替代性越来越强。 **3. 多家公司陷入人脸数据与员工数据诉讼** Meta因抓取用户照片训练人脸识别和生成式模型面临集体诉讼,此前已赔款超7亿美元;Meta还曾监控员工鼠标键盘输入以训练AI,后因泄露敏感信息暂停。 **4. AI开始自我训练但面临数据塌缩** Anthropic超80%代码由Claude编写,OpenAI用强模型自主训练弱模型。但《自然》论文指出,纯合成数据训练会导致模型“坍缩”,多样性丧失,必须叠加10%-30%人类数据。 **5. 人类数据倒计时:AI闭环即将完成** 行业配方为10%-30%人类数据打底,其余由AI自产自喂;一旦合成数据质量稳定,采集人类数据的必要性将彻底消失。
当“AI饲料”,我都被AI嫌弃了?
2026-09-29 16:22

当“AI饲料”,我都被AI嫌弃了?

本文来自微信公众号: 字母AI ,作者:苗正


2026年9月18日,纽约南区联邦法院解封了一批文件,里面包含了OpenAI和微软的内部记录。


材料显示,OpenAI和微软通过采集别人生产的内容,训练自己的模型。


但这并不是个例,我们在网上记录的点点滴滴,如今正逐渐变成AI的“饲料”。


AI不会给你点赞、收藏或者转发,因为它压根不理解你创作的内容,只是把你留下的一切收进去,变成它自己的一部分。


于是写作、绘画、说话、歌唱、拍照,这些原本属于人的事,忽然变成了AI发展的核心。


但是你也不必太担心,有一个不知道是好是坏的消息,未来AI不会再把我们当成饲料了,因为它马上学会自己造饲料。


事件来龙去脉


2026年9月17日,纽约南区联邦法院解封了一批文件。这批文件来自《纽约时报》起诉OpenAI和微软的版权案,内容是两家公司的内部记录。


在一份内部备忘录里,微软应用科学总监布伦特·赫克特(Brent Hecht)把用全网内容训练大模型称为“一场规模前所未有的惊人盗窃”,并说这很可能是“人类历史上最大的一次劳动盗窃”。这句话出自被告公司的员工,不是原告的指控。


这起官司已经打了将近三年。


原告是《纽约时报》,被告是OpenAI和微软。此前庭审的走向总体上支持“用版权内容训练模型属于合理使用”。这批解封材料的不同之处,在于它提供的是被告自己的内部记录,而不是法律论证。


微软的内部测算显示,Copilot上线后,《纽约时报》域名的点击率相比传统Bing搜索最多下降93%。


在内部演示文稿中,赫克特把这种下滑称为“死亡循环”,认为它“会同时伤害我们模型的表现,也会伤害整个互联网”。



他还写道,一个终端产品威胁到自己关键供应商的经济根基,这种情况极不寻常,但这是模型业务和它的“内容供应链”造成的局面。文稿中的“供应商”,指的就是生产内容的新闻媒体。


ChatGPT负责人尼克·特利(Nick Turley)在内部沟通中说,ChatGPT这类产品对出版机构构成“生存威胁”,而且“在很大程度上是替代性的”,“随着它们变得更强,会越来越具有替代性”。


OpenAI总裁布罗克曼说,这些模型“非常擅长新闻”。纳德拉在今年作证时承认,和聊天机器人对话“已经替代了直接去网站获取信息”。


然而法律要求不能“替代或损害原作品的市场”。


文件同时还给出了训练数据的规模。仅OpenAI的训练数据集中,就包含《纽约时报》《每日新闻》和调查报道中心的作品91692份拷贝。


在一个从Common Crawl派生的数据集中,仅nytimes.com一个域名就抓取了两百多万份文档。不过其他媒体表示,从《纽约时报》抓取390万份,从《芝加哥论坛》报及其相关报刊抓取730万份。


此外还有一个名为Project Mango的项目,其数据集包含至少160903部新闻出版方的独立作品。OpenAI把整个GPT-3训练数据集交给了微软,微软则通过Project Taxi和Project Mango把数据回输给OpenAI。


文件中还记录了具体操作方式。


OpenAI研究员尼克·赖德(Nick Ryder)告诉布罗克曼,自己有一个“绕过纽约时报付费墙的黑客方法”,布罗克曼回复“不错”。


两人搭建的数据集WebText、WebText2,有相当大一部分是从网上直接抓来的新闻报道。还从Common Crawl拉取了数百万篇文章。


此外,在数据进入模型前,他们会刻意删除版权声明,因为研究人员“不想让模型向用户输出‘版权声明’”。


原告代理律师史蒂文·利伯曼(Steven Lieberman)说,证据表明,OpenAI和微软知道自己在做的事是错的。


微软对这批文件回应称,相关言论只是反映了一名员工的个人观点,不是法律分析,更不代表公司立场。赫克特并非决策者,公司雇他是为了“呈现不同的、非对称的视角”。


还有谁在喂AI?


实际上OpenAI已经是“二进宫”了。


2023年9月,美国作家协会连同17位作家,如约翰·格里森姆(John Grisham)、乔治·R·R·马丁(George R.R.Martin)、朱迪·皮考特(Jodi Picoult)、大卫·鲍尔达奇(David Baldacci)、乔纳森·弗兰岑(Jonathan Franzen)、斯科特·图罗(Scott Turow)等人。


在纽约南区对OpenAI提起集体诉讼。此后,多起作家诉讼(特伦布莱(Tremblay)、西尔弗曼(Silverman)、夏邦(Chabon)等)陆续并入,原告规模还在扩大。


《纽约时报》诉状里的证物J,标题叫《GPT-4记忆〈纽约时报〉内容的一百个例子》,整整127页。喂给它一篇文章的开头,它能几乎逐字补完剩下的部分,连署名和引语都在。


2026年,arXiv上发布了一篇名为《对齐打地鼠》的论文。


研究者把模型微调成“按情节写全文”——只给情节摘要,不给原文。结果GPT-4o、Gemini 2.5 Pro能复现出85%到90%的版权书籍原文,单段逐字复现超过460个词。研究者给这种现象起了个名字,叫“对齐打地鼠”:你堵住一个漏洞,它在别处又冒出来。


这不是偶然。尼古拉斯·卡尔利尼(Nicholas Carlini)早在2023年就说过:模型越大、你那段数据被重复喂的次数越多、上下文给得越足,它记得就越死。


实际上扒取网上的公开资料,把人们的记录变成AI饲料的,远不止于OpenAI和微软。


2026年9月4日,一起集体诉讼递到了伊利诺伊北区联邦法院。原告是两个家庭,连同他们的孩子。诉状指控Meta未经同意,抓取Facebook和Instagram用户的照片和生物特征数据,用来训练三样东西:人脸识别系统NameTag背后的模型、给NameTag做比对用的“人脸指纹”,以及生成式图像模型Emu和Muse Image。


NameTag是给Ray-Ban和Oakley智能眼镜准备的。早在2026年6月初,就有人发现在Meta的配套App里存在NageTag相关的代码,只不过当时并不知道这个功能是干什么用的。


Meta的回应是:“这起诉讼没有依据,曲解了我们的工作……NameTag没有向消费者发布,也没有最终决定要做什么。”它还强调,自己“不是在建立一个通用的人脸数据库”。


话虽如此,但Meta已经是第三次因为人脸识别被告上法庭了。


2021年,它因为“自动标记好友”违反伊利诺伊《生物识别信息隐私法》,赔了6.5亿美元,约142万伊利诺伊用户分钱,有人拿到了400多美元。2023年,Instagram的人脸识别又让它赔了6850万美元,约400万伊利诺伊居民符合资格。Snap也因类似问题在2016年赔了3500万美元。


这部法律的罚则是每人每项1000到5000美元。


从金额来看,以Meta的用户规模,Meta可能要赔付超过10亿美元。不过Meta仍然选择付钱,毕竟相对于赔偿而言,法庭并没有阻止Meta继续开发模型,因此赔偿仍在可接受的范围内。


Meta的采集对象,也不只是用户。


2026年4月21日,Meta在美国员工的工作电脑上安装一款追踪软件,实时记录鼠标移动、点击位置和键盘输入,并定期截屏,用来训练它的AI模型。


这款工具叫“模型能力计划”(Model Capability Initiative)。Meta首席技术官安德鲁·博斯沃思(Andrew Bosworth)在内部备忘录中说,长期目标是把AI智能体培养成“承担工作”的角色,人类员工则转为“指挥、审查和协助改进”。


这个项目后来改名为“Agent转型加速器”。Meta的发言人称,这些数据只用于训练模型,不用于绩效考核,并设有保护敏感内容的措施。


但据媒体报道,采集范围覆盖员工日常使用的各类应用和网站,包括谷歌、GitHub、Slack,甚至个人Gmail;美国员工无法退出,只有受欧盟《通用数据保护条例》约束的欧洲员工被排除在外。


同一周,Meta裁掉约8000名员工,不少员工因此担心,自己正在亲手训练将来取代自己的AI。到2026年6月,Meta暂停了这项计划,原因是追踪工具抓取到了敏感信息,且这些信息一度被全公司访问。


Meta的手,也不只伸向自家平台。


Meta专门有个用来扒视频内容的爬虫,名为MSAE。Meta AI自己承认,训练数据里有370万条YouTube视频转录文本的第三方数据集。


2026年1月,包括h3h3 Productions、Mr.ShortGame Golf、Golfholics在内的几位YouTube博主,合计620万订阅,在加州中区联邦法院起诉Snap,指控它用后端自动化工具,把数百万条YouTube视频的视听文件成批下载下来,塞进HD-VILA-100M和Panda-70M数据集,用来训练“Imagine Lens”这类的图像编辑能力。


诉状没有走传统版权路线,而是主攻《数字千年版权法》第1201条的反规避:YouTube的设计是让人在线观看,不是让人拿到原始文件,Snap涉嫌在规模化层面,违反了该法律法规。


原告之一伊桑·克莱因(Ethan Klein)还顺手把英伟达、Meta、字节跳动、亚马逊、OpenAI、苹果一并告了。他的说法是,这些公司“一天能抓走80年的内容”。


搜索是谷歌的核心业务,因此谷歌也在名单上。


2026年7月,阿歇特出版集团、Cengage、爱思唯尔,连同畅销书作家斯科特·图罗,在纽约把谷歌告了,指控它用数百万本版权书籍训练Gemini。诉状称,谷歌从“已知的盗版来源”抓内容,甚至绕过学术网站的付费墙,去拿爱思唯尔旗下《柳叶刀》、《细胞》的文章。


诉状称:Gemini可以在20分钟内,用0.39美元,生成一部10万字的悬疑小说。谷歌内部文件也警告过,这么做可能“给谷歌带来100亿到1000亿美元的潜在罚款”。


语音和音乐,也没能幸免。


苹果的Siri,把“意外唤醒”时的录音交给外包合同工去听。据外媒报道,里面充斥着医生和病人的对话、商业谈判、疑似犯罪交易。有评估员一天要听多达1000条。苹果最终以9500万美元和解。


2024年6月,RIAA代表环球、索尼、华纳,把AI音乐公司Suno和Udio告了,指控它们用受版权保护的录音。


最后一批饲料


不过我们也不需要担心什么,因为我们即将成为AI的最后一批饲料。如今,AI公司,已经开始自己喂自己了。


2026年6月,Anthropic发了一篇博客,标题叫《当AI建造自己》。里面提到,截至2026年5月,合并进Anthropic生产代码库的代码,超过80%是Claude写的,不是人写的。在那之前,这个比例还只是个位数。


也就是说,15个月里,这家公司把绝大部分编程工作交了出去。有工程师已经五个月没写过一行代码;他们每天合并的代码量,是几年前的8倍。


2026年9月17日,Anthropic又发布了一份报告,标题是《衡量AI发展的速度》,这篇文章主要讲的是“研发工作有多少由AI主导”。它采用Epoch AI提出的自动化等级,从完全没有AI参与的AL0,到AI完全自主的AL5来划分。


其中AL4指AI能从一句大致的目标出发,端到端完成大部分工作,人类只负责监督和最后决策。


文章提到,2026年2月,Anthropic达到AL4这一级别的研发工作还不到1%。5月是12%,7月是22%,8月已经升到26%。


如果把标准放宽到“AI在人的密切指导下完成大块工作”的AL3,则有超过90%的研发工作达标。报告还提到Anthropic内部最主要的Agent平台上,任意时刻约有3万个AI Agent在从事研究和工程工作,仅在2026年8月就产生了超过10亿次决策。


OpenAI那边,走的是另一条路。


2026年7月,OpenAI披露,发布GPT-5.6时,它用最强的Sol模型,去自主“后训练”了一个更小的模型Luna。研究员只给了一句“相当不充分的提示”,Sol就自己找训练配置、挑GPU、启动训练脚本、验证运行,还顺带生成了合成训练数据。


这项工作,过去要两个资深研究员做两周。在OpenAI内部的“递归自我改进指数”上,Sol比上一代GPT-5.5高出16.2分。


Anthropic把这件事叫递归自我改进。它的本质,是训练数据的来源,正在从“人类生产的内容”,切换成“AI自己生成的内容”。


而你,就是这次切换完成之前的,最后一茬人类饲料。


问题是,AI自己生成的数据,撑得起下一波模型吗?


2024年,舒马伊洛夫(Shumailov)等人在《自然》上发了一篇论文,标题为《AI模型在递归生成数据上训练时会崩溃》。


他们发现,如果反复用合成数据训练模型,模型会“坍缩”,输出的多样性不断收窄,尾部信息被系统性抹掉,最后变成一种“语法正确、但语义空洞”的状态。


论文的结论是,你不能用合成数据完全替代人类数据,必须两者叠加。只要原始的人类信号还在,模型就还健康。


所以现在行业的配方,大概是10%到30%的真实人类数据打底,剩下的靠模型自己喂自己。


那10%到30%,就是我们还剩的用处。但很可惜,连这个用处也在倒计时。


一旦合成数据的质量足够稳定,一旦这个闭环转得够顺,人类数据就再也没有采集的必要。

AI行业信号频道: 前沿科技
本内容由作者授权发布,观点仅代表作者本人,不代表虎嗅立场。
如对本稿件有异议或投诉,请联系 tougao@huxiu.com。
正在改变与想要改变世界的人,都在 虎嗅APP