潜精研思 笔耕不辍

出版物/Publications更多分类

地址:北京市东城区建国门内大街26号新闻大厦7-8层

电话:86 10 8800 4488, 6609 0088

传真:86 10 6609 0016

邮编:100005

国枫视角

国枫观察 | 训练数据的原罪:美国法下AI使用公开数据训练的版权争议(美国篇·上)

发布时间:2026.09.17 来源: 浏览量:113

本文作为AI训练数据合规系列之美国篇(上),从美国司法部就OpenAI案递交的利益声明书出发,结合ROSS、Bartz、Kadrey三案的最新裁判,梳理美国法下AI使用公开数据训练的版权争议与合理使用边界,辨析训练、购书扫描与盗版馆藏等不同复制行为的裁判分歧,从律师实务视角,探讨AI企业语料来源、第三方采购与许可管理等方面的合规义务及解决方案。


作者:施忞旻 王小雅 周禹洛


一份不请自来的政府文件


2026年9月1日,一份来自美国司法部的文件递交至纽约南区联邦法院,标题是《美利坚合众国利益声明书》。它的核心立场是:仅就训练这一环节而言,为训练大语言模型而复制受版权保护的文字作品,通常具有高度转换性,倾向于构成合理使用。[1]


依据《美国法典》第28编第517条,司法部可以向法院“表达合众国的利益”,无须成为当事人。政府把自己的法律立场直接放到了法官桌上。而这份声明关切的,是集中在纽约南区进行审前程序的多起OpenAI版权诉讼,由Stein法官主持,《纽约时报》案是其中最著名的一起。[2]


而约六周前,Anthropic与图书权利人就15亿美元达成和解并获法院最终批准——历史上最大的图书版权集体诉讼和解;与此同时,美国行政机关在模型训练问题上公开支持开发者,而相关的音乐版权诉讼仍悬而未决。[3][4]


这就是当下美国的图景。对于任何一家把互联网语料、公开网页、图片库喂进模型的企业来说,这些争议和动态都将影响其在美国训练、部署、融资或面向美国市场经营时的风险判断。


一、在AI之前,

法院怎么衡量“合理使用”


美国目前没有专门针对AI训练设立的一般性版权例外,法院主要依靠美国版权法(即《美国法典》第17编)第107条的旧尺子——合理使用,即未经许可的使用也可能不构成侵权。它提供四项要素供法官逐案判断:第一,使用的目的与性质,包括商业性,以及是否具有“转换性”——是否服务于与原作不同的目的;第二,被使用作品本身的性质,创造性作品通常比事实性材料受到更强的保护;第三,使用了多少、使用的是否为作品最核心的部分;第四,该使用对原作品的潜在市场或价值造成何种影响。四项要素须综合评价,没有适用于所有案件的固定权重。其中,第一与第四要素通常最为关键。[5]


1984年的Sony案定下基调:家用录像机让观众录下免费电视节目,最高法院认定观众私人、非商业性地录下来在更方便的时间再看(“时间转移”)属于合理使用,索尼销售这一具有实质性非侵权用途的设备,也不承担帮助侵权责任,同时提醒同样的录像带若用于转售或公开放映,结论可能完全相反——技术本身不是全部问题,用途才是关键。[6] 十年后的Campbell案给出了后来最关键的概念:说唱组合2 Live Crew改编《Oh, Pretty Woman》,最高法院认定该改编可被合理理解为针对原作的戏仿,撤销下级法院否定合理使用的判决并发回重审;“转换性使用”(transformative use)由此进入主流——新使用若增加了新的表达、含义或信息,服务于与原作不同的目的,即便具有商业性,也更容易被认定为合理使用,但不是自动免责。[7]


离AI训练较近的先例是2015年的谷歌图书案。谷歌扫描了两千余万册图书建立全文检索库,用户搜索后可见若干行片段,第二巡回法院判其胜诉,理由是搜索与阅读原书的目的截然不同,片段展示无法替代购书;法官同时点明,全文复制也可以因检索目的而合理,而向公众提供多少原文、是否足以替代原作,是重要的考虑。[8] 2021年的Google诉Oracle案也认定特定Java接口声明代码的复制构成合理使用,理由包括代码的功能性、在新平台上开发应用的目的,以及复制范围,而不只是换了设备或复制比例较低。[9] 在2023年的Warhol基金会诉Goldsmith案中,最高法院收紧了第一要素,认为新的表达方式、含义或信息本身不是“转换性”的决定性因素,“被诉的这一次使用,与原作的目的是否高度相似”才是关键,若目的相同且新使用具有商业性,第一要素通常不利于合理使用。该案审查的是向杂志商业许可图像这一具体使用,而非全部创作或展示用途。[10]


四十年的脉络因此可以概括为一句话:法院愿意为真正改变了作品用途的新技术留出空间,同时警惕对原作受保护市场的替代。AI训练数据的系列案件,如今已在这条脉络上陆续展开。


二、三个案子,不同的复制行为


3.png

图1:美国AI训练数据争议时间轴


“公开数据”在法律上并不是一个统一的类别。网上能够访问到(publicly accessible)只描述访问这一事实;作品是否落入公有领域(public domain)取决于保护期与可版权性;是否已获授权则取决于权利链与许可范围;而“在网上很容易下载到的盗版书”虽可访问,却不因此成为公有领域作品或授权材料。下文的三个案子主要涉及付费的Westlaw编辑内容、购书扫描及影子图书馆里的盗版电子书。


(一)ROSS案:用竞争对手的编辑内容训练同类产品,合理使用未获支持


ROSS Intelligence是一家法律科技初创公司,想做一款用自然语言提问的法律检索工具。它需要训练数据,于是找到汤森路透,希望获得Westlaw的授权。作为未来的竞争对手,它被拒绝了。


ROSS转而向第三方公司LegalEase采购了大量“批量备忘录”(Bulk Memos)。这些备忘录里的问题,由律师依据Westlaw的判例摘要(headnotes)编写而成。ROSS用它们训练了自己的检索引擎。


2025年2月11日,Bibas法官作出部分简易判决,否定合理使用抗辩,并修订了自己两年前认为若干问题仍须审理的意见。[11] 四项要素的衡量结果如下:


第一要素(使用目的)归汤森路透。 ROSS的使用具有商业性,且不具转换性——它把判例摘要当作训练数据,用来打造一款与Westlaw竞争的检索工具,两者目的高度相似。ROSS辩称复制只发生在中间环节、最终产品中并不出现判例摘要,并援引游戏机反向工程的一系列先例。法官逐一驳回:那些案件涉及的是计算机代码(功能性作品),且复制是接触底层功能所必需的;本案中,“ROSS完全有能力自行或委托LegalEase在不侵权的情况下创造所有汤森路透创造的东西”。


第二要素(原作性质)归ROSS。 判例摘要虽有编辑判断,创造性程度低于小说或艺术作品;Key Number分类体系也有较低程度的创造性。法官同时提醒,这一要素“在合理使用争议中极少起到显著作用”。


第三要素(使用数量与实质程度)归ROSS。 用户从ROSS得到的输出是判决书本身,其中不含Westlaw的判例摘要,因而未向公众提供任何可用于替代原作的内容。


第四要素(市场影响)归汤森路透,并成为胜负手。 法官认定,原始市场是法律检索平台,而“至少还有一个明显的潜在衍生市场:用于训练法律AI的数据”。至关重要的一句是:汤森路透自己是否已经进入这个市场并不重要,需要评价现实或合理可能发展的潜在市场,而不只限于已经开展的交易。举证责任在主张合理使用的一方,ROSS未能证明这些市场不存在或不受影响。


两项要素偏向ROSS,两项偏向汤森路透,但因第一与第四要素分量最重,合理使用抗辩被否定。


判决末尾,Bibas法官留下一句限定:“鉴于AI领域变化迅速,我向读者说明,今天摆在我面前的只有非生成式AI。”(当用户输入法律问题时,ROSS只是把已经写好的相关司法判决返回给用户,未生成新内容)这句话让ROSS案的射程存疑,也让它的上诉格外重要。


截至目前,案件本身尚未全部终结,Bibas法官仅形成一份部分简易判决,法院准许就合理使用等问题提起中间上诉。案件现已进入第三巡回法院,2026年6月11日进行了言词辩论;截至9月13日,尚未见公开发布的上诉判决。[12] 这是AI训练合理使用问题的一起重要联邦上诉案件。如作出具有先例效力的判决,将约束第三巡回辖区内的地区法院,对其他法院具有相当的说服力。


(二)Bartz案:训练用途不能为永久盗版馆藏免责


4.png

图2:Anthropic的数据链与分项评价


Bartz v. Anthropic案则对生成式AI的训练活动提供了更直接的评价。[13]


2021至2022年,公司从 Books3、LibGen、PiLiMi等“影子图书馆”来源取得了超过七百万份盗版图书复制件。内部记录显示,公司知道相关来源存在盗版问题,仍建立并计划永久保留“中央图书馆”数据库,包括未被选入训练或不再用于训练的材料。


2024年2月,Anthropic换了一条路:聘请谷歌图书扫描项目的前合作负责人,开始大规模购买纸质书,拆掉装订、逐页扫描成数字文件,随后销毁纸本。


这两批书最终汇入同一个“中央图书馆”,再从中抽取子集组成训练数据,喂给模型。Alsup法官在2025年6月23日的裁定中,把它们拆成三笔账分别计算。


第一笔:训练用的复制件。 模型学习统计关系、生成不同文字,目的与阅读书籍不同,因此用图书训练大模型具有高度转换性,第一要素支持合理使用。第三要素上,Anthropic虽复制了完整作品,但法院结合训练目的认为数量合理;本案又无输出侵权主张。在第四要素上,作家主张模型的输出会稀释图书市场,法官不予采纳,而认为:作家的抱怨“与抱怨教会小学生把文章写好会导致竞争作品爆发式增长并无不同”,“这并非版权法所关切的那种竞争性或创造性替代”。除第二要素外,各要素均支持合理使用,结论是构成合理使用。


第二笔:由已购纸本转换而来的数字馆藏。 同样构成合理使用。理由朴素:Anthropic只是用一份更省空间、更便于检索的数字件,替换了自己已经花钱买来的纸本,扫描后销毁纸本,未保留额外馆藏副本,也未对外分发。第一与第三要素支持,第四要素中立,仅第二要素略微不利。


第三笔:盗版馆藏。 四项要素全部不利。法官写道:“Anthropic无权将盗版复制件用于其中央图书馆。建立一个永久性的通用图书馆,本身并不构成可以为盗版行为开脱的合理使用。” 更值得注意的是紧接着那半句——“盗版复制所生的赔偿责任,不因其后购买同一作品而消除。


后来花的钱,买不回先前的行为。判决中还有一句留给整个行业的话:“版权法中并不存在为AI公司留出的例外。


值得留意的是这三笔账的切分方式。法院并没有按语料来源给“训练”贴上合法或非法的标签——就训练用的复制件而言,裁定未区分其源自购书扫描还是盗版下载,一并认定为合理使用。被否定的是另一件事:为建立一座永久保存、供通用用途的图书馆而实施的下载与留存。那是一项独立的复制行为,需要独立的正当性理由,而Anthropic没有给出。


这才是Bartz案最值得记住的启示:不同复制用途需要独立评价;训练的转换性,不能自动为建立永久通用盗版馆藏的复制免责。


Anthropic在盗版馆藏部分的合理使用抗辩被否定后,2025年8月双方签署和解条款清单,2026年7月20日获法院最终批准:不可返还的和解基金15亿美元,覆盖48万余件作品,每件作品在扣除费用与成本前预计赔付约3,000美元,为普通侵权法定最低赔偿额的四倍。法院称其为“历史上最大的版权集体诉讼和解”。[14]


和解集体限于Anthropic从LibGen或PiLiMi下载的版本中,列入作品清单的合格图书权利人。解决的却不只是取得环节的请求,还包括约定的历史训练等使用争议。协议要求销毁相关盗版文件,同时保留模型输出与2025年8月25日及之后行为的请求,不构成未来训练许可。换句话说,15亿美元解决的是约定范围内的历史争议,而不是未来训练的通行证。


但这次和解覆盖的只是清单内的合格图书权利人,除此之外,仍有音乐出版商的诉讼正在进行中,Concord Music案在加州北区审理,Round Hill Music与Sony Music Publishing也于同年8月另行起诉。[4]


(三)Kadrey案:市场稀释可能影响合理使用,但不能缺少证据


Bartz案裁定作出两天后,同在加州北区,Chhabria法官就训练复制问题作出有利于 Meta的部分简易判决。[12] 但这份判决实则给AI公司带来危机。


十三位作家指控Meta使用其作品训练Llama模型。法院记载,Meta曾尝试取得许可,但没有成功;它从LibGen及 Anna’s Archive等影子图书馆来源下载材料,部分下载采用BitTorrent。这项技术从多台电脑取得文件碎片再重组,默认也允许上传。Meta编写脚本阻止下载完成后的“做种”,但是否阻止了下载中的上传、是否实际上传原告作品,仍有争议。原告据此另行主张,Meta在获取这些书的同时也在“发行”这些书。[12]


判决开篇,Chhabria法官给出了一个与最终结论相反的一般性判断:企业未经许可将受版权保护的材料喂进模型,这样做是否违法?“魔鬼在细节里,但在多数情形下,答案很可能是肯定的。”他的理由是市场。生成式AI有能力以海量作品淹没市场,而人们只需付出极小的时间与创造力就能生成这些内容。他以传记举例:罗伯特·卡罗的《参议院大师》大概不受影响,因为它位居太多人的书单之首,“但你可以打赌,那些名气较小的林登·约翰逊传记,市场一定会受到影响”。杂志文章更为脆弱,尤其在AI生成的文章免费提供的情况下。至于虚构作品,经典也许无虞,“但典型的言情小说或间谍小说,其市场可能因同类AI作品的涌现而大幅萎缩”。


针对“训练具有转换性因而免责”的通行主张,他直接回应:转换性确实降低侵权的可能,但“并不存在这样一条规则,即只要你对受保护作品的使用具有转换性,就自动免于侵权指控”。他写下了本案最锋利的一句——“在合理使用原则下,对被复制作品市场的损害,比复制所服务的目的更为重要。” 判决同时点名批评了两天前的Bartz案,认为Alsup法官过度倚重转换性。


但结果是,Meta胜诉了。判决把作为本案胜负手的第四要素下原告可能主张的市场损害归纳为三条路径,逐一检视:[12]


其一,模型复吐原作。 本案证据不足以支持原作替代。Meta专家即便使用专门诱使模型复吐的“对抗性”提示,也未得到超过50个词和标点的原告作品内容,原告专家亦未证明可复现显著比例。作为对照,谷歌图书案中特定搜索记录可累计展示约16%的图书内容,仍未形成有效替代。


其二,训练许可市场受损。 本案法院不接受这一损害理论。法院指出,在任何一起合理使用案件中,只要把“潜在市场”定义为“该项使用的理论许可市场”,权利人都会自动受损——为避免第四要素分析陷入循环并在每个案件中都偏向权利人,判决指出,“因丧失转换性用途的许可费而产生的损害不具可诉性”。


其三,间接竞争与市场稀释。 此处市场稀释论是指海量AI产出整体挤压原作市场,即便产出本身不侵权。法院称这条路径“更可行”(far more promising),并承认它可能成为法律上可以考虑的损害。但原告“在市场稀释问题上完全没有提出任何有意义的证据”。


正因为Meta的使用高度具有转换性,原告“需要在第四要素上取得决定性的胜利“才能击败合理使用抗辩。在这样的证据记录之下,第四要素只能判给Meta。


判决末尾,法院不接受Meta与Sag教授等“稀释不计入第四要素”的立场:“在涉及Meta这类使用的案件中,只要原告就被告使用行为的市场影响建立了更充分的证据记录,看来他们往往会胜诉。” 他同时勾勒了反向情形——若为国家安全或医学研究等非营利目的训练模型,即便存在一定程度的市场稀释,仍有可能构成合理使用。


至于BitTorrent文件共享过程中的上传是否构成“发行”,法院把复制权与发行权视为两项独立的权利,明确将这一请求留待后续程序处理。


这场诉讼中,Meta赢在本案证据,法院却未采纳它关于市场稀释的全部法律观点。判决因此也像一份写给后来原告的诉讼指引。而这份指引,正是后来司法部在《美利坚合众国利益声明书》中集中反驳的目标。


(四)分歧在哪里


5.png

图3:三起判决的四要素归属


把三个案子并排来看,Bartz案与Kadrey案在“训练是否具有转换性”这一点上相当接近:Alsup法官称之为“我们此生所见最具转换性的技术之一”,Chhabria法官承认“作为事实问题,这一点无可争辩”;ROSS案的Bibas法官则因ROSS的产品与Westlaw直接竞争而作出否定,但他明确限定,其结论只涉及非生成式AI。


真正的分歧有两处。


第一处是非侵权AI产出的市场稀释,能否计入第四要素。 Bartz案把新作品增加带来的竞争,类比为更多人学会写作,不认为它是版权法保护的市场替代;Kadrey案却认为,利用原作训练的工具大量生成同类作品,可能损害原作市场与创作激励。两案虽都认定训练合理使用,对这一损害理论的态度却不同。


第二处更为根本:训练许可费的损失,能否计入第四要素。 ROSS案的答案是肯定的——法官认为“用于训练法律AI的数据”是明显的潜在衍生市场,且权利人是否已经实际进入并不重要,这大概率是基于ROSS同类产品直接竞争的背景。Bartz案与Kadrey案未将高度转换性训练用途的许可费损失计入受保护损害,但它们并非否认现实中的许可交易:Bartz案认为版权人无权仅凭“对一项转换性使用收费”来主张损害,Kadrey案则指出,若把“潜在市场”定义成“该项使用的理论许可市场”,权利人将在每一起合理使用案件中自动获胜,第四要素的分析就此陷入循环。


分歧因此落在一个更窄的问题上:哪些许可市场属于版权法承认的传统或合理的潜在市场,哪些只是从“先假定必须许可”倒推出来的循环市场。第三巡回法院对ROSS案上诉的判决可能会给出这个问题上的更明确指引。


三、政府为什么此时下场


回到开头那份文件。司法部的论证有一个清晰的骨架,同时也是一份现成的抗辩提纲。


它首先把AI的生命周期切成两段:训练阶段与输出阶段,“每一阶段可能引发各自独立的著作权问题”。政府只就训练阶段表态。


在第一要素上,训练中的复制被定性为“一种不同种类或性质的使用”,具有转换性。在第四要素上,训练用的复制件本身不“替代原作”,也“压缩原作受保护的市场机会”;至于模型的输出,若与原作不构成实质性相似,其带来的竞争"通常发生在著作权并不保护的利益之上"。


文件用相当篇幅直接批评Kadrey案的说理,称其“错误适用了著作权原则”,其市场稀释理论“忽略了著作权侵权最基本的构成要件之一——作品是否实质性相似”,并把训练(复制全文但不对公众开放)与输出(可为公众获取但通常缺乏实质性相似)混为一谈。


最后是政策论证:若强制许可,只有体量最大的科技公司负担得起许可费,而许可收益将因发表体量而不成比例地流向传统媒体;至于这项新技术是否值得“全面改写著作权原则”,“是应当留给人民及其民选代表的政策问题”。


这份文件不具约束力,提交方并非当事人,法院没有采纳的义务。它的实际影响,取决于法院是否在说理中予以采信。但它确实传递了一个明确信号:在“文字作品用于大模型训练是否构成合理使用”这一个问题上,联邦行政机关站在开发者一侧。但这一态度性文件不会为盗版取得、删除署名、版权声明等版权管理信息或侵权输出提供任何豁免,也不能改变美国版权法第107条的法定标准。[1][15]


四、对AI企业的启示


第一,语料来源台账是首要的合规资产。 不同复制目的,需要对应的证据。台账应当能够就每一批语料分别明确来源主体、取得方式、是否支付对价、取得时间、授权链与授权范围,并保留网页条款快照、机器可读声明的状态、数据版本等,以及实际训练使用与删除记录,用以在诉讼之中有效区分和证明各环节的合规责任。


第二,事后购买通常不能追溯消除既往责任。 法官在Bartz案中明确,盗版复制所生的赔偿责任不因其后购买同一作品而消除。企业若在早期使用过来源不明的公开数据集,重新采购正版并不能抹去既往风险;但删除、替换、补充许可、和解与停止使用,可能会影响持续风险的大小以及救济与赔偿的计算。


第三,第三方语料采购的尽调应当穿透到上游。 供应商在合同里作出的权利承诺,不能当然排除企业对权利人的侵权责任——ROSS案中被诉的正是通过第三方间接取得的材料;这类承诺的真正作用,是形成对供应商的追偿、审计与风险分配机制。尽调应当要求供应商说明其自身的取得方式,并在合同中约定来源披露义务、审计权与相应赔偿。


第四,许可的作用在于取得授权,而不在于改善合理使用抗辩。 训练许可费损失的评价,须结合各案事实背景,因此把“对方本来也没打算出售训练数据”当作抗辩依据是有风险的。但许可的作用在于:一份权利链完整、且在作品范围、复制环节、训练用途、模型与期限上均覆盖实际行为的许可,使相关复制成为经授权的使用,本就无须再依赖合理使用抗辩;而普通购书、网页订阅或供应商的一纸保证,不当然授权一切复制与训练。付费本身也不会把一项商业性使用变成非商业性使用——Bartz案中购书扫描获得的宽容,来自“以数字件替换自己已购纸本”这一特定情形,并不意味着普遍存在“格式转换权”;反过来,没有专门训练许可,也不当然排除合理使用。


第五,训练侧与输出侧分开治理。 司法部的分阶段框架同样是抗辩框架。输出过滤、去重、防止逐字复现等工程措施,可为第四要素的评价提供重要证据——Kadrey案中“特定对抗性测试也未得到超过50个词和标点的内容”这一事实,正是Meta反击第一条市场损害路径的关键。这类措施的合规价值独立于取得环节,但也无法替代上游的来源治理,更没有形成固定的词数安全线。


小结:版权法之外还有什么


就本文所讨论的版权纠纷,现阶段给出的回答可以浓缩为:作品可以公开获得,并不等于可以任意复制;训练用途纵然高度转换,也不会自动为独立的盗版复制或发行行为免责。取得、保存、训练、分发、输出,需要识别各环节中的具体受控行为与用途,任何一环的结论都不会自动覆盖其他环节。


但版权只是问题的一半,AI使用公开数据训练的合规与否,逃不开版权,却也不仅仅限于版权。本文下篇,我们将就用户协议、抓取限制与州法义务等开展讨论,敬请关注。


查看参考文献

[1] Statement of Interest of the United States of America, In re OpenAI, Inc. Copyright Infringement Litigation, MDL No. 3143, No. 1:25-md-03143-SHS-OTW(S.D.N.Y. 2026-09-01),ECF 1682,文件原文。政府表达利益的法律依据为28 U.S.C. §517。

[2] JPML, Transfer Order, In re OpenAI, Inc., Copyright Infringement Litigation, MDL 3143(2025-04-03),转移令原文。JPML 是“联邦多区诉讼司法委员会”(Judicial Panel on Multidistrict Litigation);MDL 是“多区诉讼”(multidistrict litigation),依据28 U.S.C. §1407将有共同事实问题的案件集中处理审前程序,结束后原则上发回原法院,已经依法终结的案件除外。它不同于依《联邦民事诉讼规则》第23条进行的集体诉讼。该转移令将相关 OpenAI 案件交由纽约南区 Sidney H. Stein 法官集中处理。

[3] Bartz v. Anthropic, ECF 680(N.D. Cal. 2026-07-20),Martinez-Olguin 法官,和解最终批准令。作品清单482,460件;约3,000美元与普通侵权750美元的比较见批准令第17页。17 U.S.C. §504(c)规定普通法定赔偿750–30,000美元,故意侵权可提高上限至150,000美元,符合无辜侵权条件时可降至200美元;这些法定数额不是本案逐件确定的赔偿。集体范围、历史请求的放弃及销毁义务见和解协议第1.7、1.29、2.2、3.1条,并与批准令第7–11页对读。和解并不适用于2025年8月25日当日及之后的任何行为所引发的赔偿请求。每件约3,000美元不是每位作者的保证实收款项。请求放弃包括约定的历史下载、上传、扫描、留存及训练、研究、开发和生产等使用;销毁义务保留必要的诉讼证据保存安排。

[4] Concord Music Group v. Anthropic PBC, No. 5:24-cv-03811(N.D. Cal.),公开卷宗;Round Hill Music LP v. Anthropic PBC, No. 5:26-cv-08505(2026-08-17起诉),Round Hill诉讼公告。Sony Music Publishing (US) LLC et al. v. Anthropic PBC et al., No. 5:26-cv-09217(2026-08-28起诉),诉状原文。Sony案原告也包括Warner Chappell Music等。

[5] 17 U.S.C. §107。第四要素“无疑最重要”的表述见 Harper & Row v. Nation Enterprises, 471 U.S. 539, 566(1985),判决原文;四要素须共同评价及第一要素的重要性见 Campbell, 510 U.S. 569, 578–579、590–591(见注释[5])。第一与第四要素分量较重的概括见 Authors Guild v. Google, 804 F.3d 202, 220(2d Cir. 2015,见注释[6])。第二要素还考虑作品是否已发表;第三要素结合目的判断复制数量;第四要素包括受保护衍生市场的合理潜在影响。

[6] Sony Corp. of America v. Universal City Studios, 464 U.S. 417(1984),国会图书馆收录的判决原文。帮助侵权是因促进他人的侵权而承担的责任,不同于亲自实施复制的直接侵权。索尼免责的重要依据包括设备具有实质性非侵权用途,因此应区分用户的时间转移与制造商责任,而不能将本案直接等同于开发者亲自复制训练语料。

[7] Campbell v. Acuff-Rose Music, 510 U.S. 569(1994),国会图书馆收录的判决原文。最高法院撤销并发回,未在该次裁判中完成所有市场证据的终局认定。

[8] Authors Guild v. Google, 804 F.3d 202(2d Cir. 2015),No. 13-4829,判决原文。约16%的数字来自该案特定片段搜索记录,并非合法展示比例。

[9] Google LLC v. Oracle America, 593 U.S. 1(2021),最高法院判决原文。API(application programming interface)即应用程序编程接口,供程序调用既有功能。法院假定争议声明代码可受版权保护后,认定具体复制合理使用;并非裁定所有 API 均无版权,也不只是因为换设备或复制比例低。

[10] Andy Warhol Foundation for the Visual Arts v. Goldsmith, 598 U.S. 508(2023),最高法院判决原文。审查对象是向杂志商业许可图像这一具体使用的第一要素,而非对所有创作、收藏或展示用途作全面合理使用判断。

[11] Thomson Reuters Enterprise Centre GmbH v. ROSS Intelligence, No. 1:20-cv-00613-SB(D. Del. 2025-02-11),ECF 770,Bibas 法官,裁判原文。数据采购及意见修订见第2–4页;四要素见第15–23页。2023年意见主要保留争议供审理,并非终局认定合理使用。headnotes 是编辑对判决中法律要点的提炼,Key Number System 是 Westlaw 的法律主题编号体系。简易判决(summary judgment)指不存在影响结论的重大事实争议时,法院直接依法裁判;此处为部分简易判决,仍有问题留待后续处理。

[12] Thomson Reuters v. ROSS, No. 25-2153(3d Cir.)。2026-06-11辩论及截至2026-09-13的公开状态,见公开上诉与辩论索引;排期另见ROSS公告。法院录音见第三巡回法院录音入口。公开索引不等同于实时完整卷宗,后续进展以法院文件为准。 本次属于中间上诉,即在全案终结前先行审查获准上诉的重要问题,并非已有全案终局判决。

[13] Bartz v. Anthropic PBC, No. 24-cv-05417(N.D. Cal. 2025-06-23),ECF 231,Alsup 法官,合理使用裁定原文。下载及馆藏事实见第2–6页;按具体使用分别判断见第7–9页;第三要素见第19–23页;第四要素及结论见第23–32页。训练复制件的评价未依购书扫描或盗版来源分别得出不同结论,但并未据此认可永久盗版馆藏。对中央图书馆另行产生、未用于训练的其他复制件,证据记录不足,法院未作简易判决。 影子图书馆指通常未经相关权利人授权、提供免费材料的在线资源库。LibGen(Library Genesis)及 PiLiMi(Pirate Library Mirror)下载分别发生于2021年6月、2022年7月;七百万的口径是复制件,不是互不重复的作品。购书扫描获认可的是“一本换一份”、销毁纸本的特定事实,不是普遍格式转换权;三笔账也不是所有案件必经的固定法律阶段,单纯持续保管文件不必然产生新复制。

[14] Kadrey v. Meta Platforms, No. 3:23-cv-03417-VC(N.D. Cal. 2025-06-25),ECF 598,Chhabria 法官,训练争议裁定原文。下载、上传争议与测试记录见第6–8页;许可市场、原作替代与市场稀释见第24–40页。“50”指原文所谓“words and punctuation marks”,裁定将其称为 tokens,并非所有模型分词器采用的技术 token 定义或安全线。2026-03-25 ECF 700后续裁定准许加入帮助侵权请求,并说明训练裁判不约束未参加诉讼的拟议集体成员;准许修订不代表帮助侵权已成立。 做种(seeding)指下载完成后继续共享文件。“市场稀释”在此指大量非侵权产出挤压原作市场;合理使用抗辩的整体举证责任仍在 Meta;对原告证据缺口的批评,不等于权利人在所有案件中都须先证明实际损失。

[15] 17 U.S.C. §1202(b)、(c)。第1202条涉及版权管理信息,不应与第1201条的技术措施规避规则混同;DMCA 是《数字千年版权法》(Digital Millennium Copyright Act);CMI 是版权管理信息(copyright management information),包括随作品传达的作者、权利人、标题、版权声明、使用条件及相关识别信息。第1202(b)款规制未经授权故意删除、改动信息及明知信息被违法删除仍传播等行为,还要求知道或在民事救济中有合理理由知道该行为会诱发、促成或掩盖侵权。删除本身不当然违法,也非所有元数据都属于 CMI。


1789870332948148.png

相关人员