本文作者:游云庭(知识产权律师),题图来自:AI生成
随着业界瞩目的纽约时报诉OpenAI公司案审判进入白热化,因为OpenAI对法院进行误导性陈述并隐匿输出日志的关键证据,走向对其日渐不利。但近日案件却峰回路转,美国司法部向美国纽约南区联邦地区法院提交了《美国利益陈述书》,主张大语言模型训练阶段使用作品构成合理使用。今天就和大家聊一下,美国司法部在这份文件中如何帮AI公司洗脱训练数据未经许可的原罪以及对应的原因。
版权人起诉大模型公司违法,套路就是把未经许可抓取作品的行为和生成近似内容进行绑定,纽约时报在诉状里展示了ChatGPT能复述、甚至逐字吐出其文章,所以训练用的是赃物,产出的也是赃物,训练就是为了实质性替代版权人的作品。但美国司法部来了个釜底抽薪,其将AI运作系统拆解为三个环节:训练数据的获取、模型训练以及模型输出。
1、训练数据的获取是模型通过海量数据学习语言模式、逻辑结构的过程。司法部认为,这一阶段的数据使用是一次纯粹的技术行为,模型不是在阅读文章,而是在学习语言的统计规律,通过统计学习提取抽象知识。这种方式与传统的复制粘贴式侵权行为完全不同,更类似于人类阅读大量书籍后形成自身的知识体系。
2、而模型训练则是针对特定任务对模型进行优化。司法部强调,这一阶段的数据使用具有高度的转换性,将原始数据转化为全新的、具有独立价值的模型能力。根据美国版权法的合理使用规则,转换性使用是判断合理使用的关键因素。转换性意味着对原作品进行了新的表达、新的意义或新的信息传递,比如评论、学术研究。美国司法部援引美国最高法院和第二巡回法院关于Google扫描图书、软件代码等案件的判例,强调版权作品被用于一种全新的技术目的时,即使存在完整复制,也可能属于合理使用。
3、模型输出是模型生成内容的环节。司法部认为,即使输出内容偶尔与原作品高度相似,甚至构成侵权,也不影响训练阶段的合法性。换句话说,输出端的侵权风险与训练端的合理使用认定是两个独立的法律问题。
这种三阶段的拆分,实际上为AI企业构建了一道法律防火墙:训练阶段的合法性不受输出阶段争议的连带影响。在这套框架下,训练阶段对版权作品的复制被孤立出来,输出端是否生成侵权内容、是否替代人类创作者,那是另一个问题,不能倒过来污染训练阶段的合法性。
在《美国利益陈述书》中,司法部还重点驳斥了市场稀释理论。因为合理使用的前提是对作品的合理使用不能不合理地损害原作者的利益。在2025年的Kadrey起诉Meta案的判决中,法官认为,即便AI生成的文章、图片、音乐没有复制某一篇具体作品,它们仍然可能因为大量进入同类市场而挤压原作者的市场。但司法部认为,这种仅仅因为属于同类作品就认定市场受到损害的理论过于宽泛。只要AI输出没有实质性复制原作品,就不属于版权法第四因素所要保护的市场损害。
在《美国利益陈述书》的开头,司法部解释了自己持优待AI公司立场的原因,其首先引用了美国宪法的版权条款,认为该法的立法目的不是奖励作者的劳动,而是促进科学和实用技艺的进步。赋予创作者一定期限的垄断权,只是实现这一终极目标的激励手段,如果对版权垄断权的保护过度扩张,导致一项具有革命性的通用技术被锁死在许可授权的繁琐流程中,就背离了宪法设立版权制度的初衷。
然后再从实践上进行论证,顶尖大模型的训练依赖极其海量、多元的数据集,要求AI公司对每一条训练数据逐一取得授权在操作上完全不可行。同时突出国家利益,如果通过严厉的版权禁令限制美国科技企业使用训练数据,无异于强行给美国AI产业戴上枷锁。最后再说国家安全,这将直接削弱美国在下一代前沿人工智能领域的全球领先地位,让不受此类版权规则约束的外国对手趁虚而入,最终损害美国的国家安全与经济竞争力。
通读了《美国利益陈述书》,笔者认为,该文件文如其名,确实是要求美国的版权保护为美国赢得AI产业竞赛的宏大利益让路。但法院会不会对此买账,我个人持怀疑态度,因为即便在美国政府内部,这种特朗普施政风格明显的文件也是有争议的。2025年5月,美国版权局曾经发布过一份预览版的《生成式AI训练白皮书》,很多内容和司法部这份文件堪称针锋相对,虽然其承认用版权作品训练大模型具有转换性,但认定训练是否构成合理使用,在模型部署之前没有确定答案。其还提出了大模型使用版权作品训练有三类市场损害:直接替代、市场稀释和许可市场的丧失。所以纽约时报诉OpenAI等的案件后续走向,仍有待观察。
本文作者:游云庭(知识产权律师)。Email: yytbest@gmail.com,本文仅代表作者观点。
