15 亿美元版权和解之后:AI 训练数据的法律边界
15 亿美元版权和解之后:AI 训练数据的法律边界

2026 年 7 月 20 日,美国联邦地区法官 Araceli Martínez-Olguín 正式批准了一项金额 15 亿美元的版权和解协议。这笔和解涉及 482,460 部作品,经过摊算每部作品约 3,000 美元。

3000 美元这个数字需要一点背景才有意义:它是美国司法实践中单部作品侵权最常见处罚金额的约 4 倍。也就是说,如果这场争议最终以逐部作品的法定赔偿方式裁决,结果大致就是这个量级。

而这个案件真正的价值,不在于金额,而在于法官在前一份判决里划出的一条线——它把「用 AI 训练模型是否构成合理使用」这个被讨论了两年的问题,从「用途」彻底转移到了「取得方式」。

这条线一旦被画下,后续的所有诉讼都在同一个框架里展开。而 2026 年 8 月 28 日索尼音乐与华纳查普尔提起的新诉,就是这个框架的第一个大规模验证。

一、Bertz 判决的两段式结构

2025 年 6 月,法官 William Alsup(后由 Martínez-Olguín 接手和解阶段)在这个案子里作出了一个结构上非常特别的判决。它的特别之处在于:同一批事实,被拆成了两段,分别得出相反的结论。

行为判决理由结构
购买实体书,扫描后用于训练合理使用这是「转换性使用」的典型形态——内容被用于训练模型,而非用于替代原作品
从盗版源下载电子书并存档构成侵权与最终用途是否合理无关——取得方式本身就是违法行为

这段判决最重要的贡献是确立了「取得方式独立于用途」的审查逻辑。在这条逻辑下,「我买书是为了训练,训练是合理使用」这个论证链条在第二段被切断了:即使训练确实属于转换性使用,购买行为本身合法,但从盗版源取得并存储副本这个动作独立构成侵权,不因后续用途合理而获得豁免。

这个区分在法理上并不新(购买行为合法与取得来源合法本就是两件事),但在 AI 语境下它产生了一个非常实际的后果:企业无法用「最终用途是合理使用」来为数据获取的合规性辩护。数据溯源从一项「最好有」的合规实践,变成了「必须做」的法律义务。

二、和解的数字,以及它的算法

把 15 亿美元和 482,460 部作品放在一起,可以还原出这个和解的定价逻辑。

项目数值
和解总额15 亿美元
涉及作品数482,460 部
摊算单价约 3,111 美元/部
对照:单部侵权常见处罚约 750 美元级别
倍数约 4 倍

4 倍这个倍数是这份和解真正的信息含量所在。它说明的不是「这批作品特别值钱」,而是「大规模系统性侵权的赔偿水平显著高于单个偶发情形」——因为在一个包含 48 万部作品的案件里,被告无法主张「无意中碰到了一首」,事实模式本身就是系统性的。赔偿倍数是对主观恶意和系统性的定价,而系统性的定价远高于个体。

还有两个细节需要注意。其一,Anthropic 在和解中没有承认自身行为违法——这是此类和解的常见结构,法律结论由法院批准,但责任认定并未被明确接受。其二,2026 年 7 月 20 日的批准意味着这笔钱从「待定」变成了「终局」,同时也为后续案件提供了一个可参照的价格锚。

三、700 万本盗版书:数据规模本身成为事实

和解涉及的作品数不是抽象的,它背后有具体的获取方式被记录在案:Anthropic 通过 BitTorrent 下载了超过 700 万本盗版电子书,另有员工从其他来源下载了 200 多万本。

获取渠道规模性质
BitTorrent(分布式协议)700 万本以上盗版源,且是点对点共享网络
其他来源200 万本以上渠道不完全明确
合计约 900 万本量级——

这两个数字和 482,460 部作品的关系需要说清楚:900 万本是下载总量,48 万部是进入诉讼和解范围的作品数,两者不是同一个口径。900 万这个数量级说明的是数据获取的规模化和体系化程度——通过分布式协议获取数百万份文件,不可能是人工逐本操作的结果。这类事实认定在法庭上的分量很重,因为它直接排除了「无意中」这个抗辩空间。

同时也要指出一个技术细节:BitTorrent 是一个点对点共享协议,意味着获取过程中,公司的服务器同时在为他人提供内容分发。这一点在法律上比单纯的「下载」更复杂,因为它涉及的是分发行为而非仅仅复制行为。这也是为什么这类案件里数据获取的架构设计(用什么协议、是否做种子、是否有缓存层)会成为争议焦点,而不仅仅是「你有没有用盗版」。

四、2026 年 8 月 28 日的新诉:把赌注押在「取得方式」上

就在和解终局后一个月,索尼音乐和华纳查普尔在加州北区联邦法院对 Anthropic 提起新的诉讼。索赔金额是每件作品最高 15 万美元,按指控的作品范围计算,损失可能达到数十亿美元。

这份诉状最值得注意的是它的结构设计——原告方把整个行为链条拆成了六段独立指控。这个拆法本身就是一种论证。

拆解出的环节它在论证什么
1. BitTorrent 下载取得方式本身违法,与用途无关
2. 网页抓取系统性抓取受版权保护的公开内容
3. 第三方数据集数据集来源的合法性未被尽调
4. 训练中的复制训练过程构成对作品的复制行为
5. 模型输出模型能够生成与原作实质相似的内容
6. 删除版权管理信息移除作品的版权标识

把这六段和 Bertz 判决的两段式结构对照,就能看出原告方的策略:它不再只赌「用途是不是合理使用」,而是同时从六个方向施加压力。第 1 段完全对应 Bertz 已经确立的「取得方式独立定罪」逻辑,这是它最稳的一段;第 4、5 段则是在争夺「训练中的复制算不算复制」这个尚未有定论的问题,是它最激进的两段。第 6 段是技术性最强的一段,因为删除版权管理信息(CMI)在美国法下的责任认定路径相对明确,不需要证明实质性相似。

15 万美元这个索赔标准也值得单独说:它是美国版权法项下法定赔偿的上限,而每件作品的最高法定赔偿通常适用于「故意侵权且情节严重」的情形。换句话说,原告方选择最高档的索赔,直接主张的是「故意且情节严重」这个定性。这比索赔金额本身更能说明诉讼的对抗强度——它的目标可能不是拿到 15 万,而是拿到一个「故意侵权」的判决。

需要说明的是,这类主张在法庭上的最终认定仍存在重大不确定性,诉状中的指控在判决前都不构成事实认定。本文引用的是诉讼主张本身及其结构逻辑,不对其成立与否做预判。

五、相邻战场:Suno、纽约时报与政策变量

版权争议已经从单一案件扩展成多条并行的战线,而且政策变量正在成为左右天平的因素。

案件时间争点
UMG 与索尼诉 Suno2025 年 9 月提起流媒体抓取(stream-ripping)指控——不是训练本身,而是内容获取环节
纽约时报诉 OpenAI进行中内容复制与输出相似性
美国政府介入支持 OpenAI2026 年 9 月政策层面的介入
法院裁定政府未证明 Anthropic 构成国家安全风险2026 年 8 月国家安全审查路径被否

UMG 和索尼诉 Suno 的指控方式是这一批案件里最值得学习的一个,因为它绕开了最难的问题。它不主张「训练生成式音乐属于合理使用」——那是一个尚无定论的抽象问题;它主张的是「获取环节存在流媒体抓取」,这是一个可以具体举证、可以量化的行为问题。绕开抽象争议、直接攻击具体环节,是这一批原告方共同采用的策略,也是 Bertz 判决逻辑的必然延伸。

2026 年 8 月那条「法院裁定政府未证明 Anthropic 构成国家安全风险」的判决,则说明版权与国家安全这两条审查路径目前是相互独立的。一个数据集被判为具有国家安全风险,会走完全不同的法律程序和救济路径,而这条路径在 2026 年 8 月对 Anthropic 是关闭的。这意味着版权仍然是主要战场,企业不能指望用「有争议所以需要国家安全审查」来延后解决版权问题。

而 2026 年 9 月美国政府在纽约时报诉 OpenAI 一案中介入支持 OpenAI,则显示政策考量已经开始影响诉讼走向。这类变量在预测法律结果时是最难量化的,但对企业决策的影响是实质性的——它意味着「先起诉再说」的策略在特定时期对部分主体更有效。

六、给使用 AI 的企业的五条合规动作

Bertz 判决已经把合规要求说得非常明确了。以下五条按优先级排列。

第一,建立数据来源台账,且要能逐条追溯到具体许可。Bertz 判决的核心是「取得方式独立定罪」,所以合规的最小单位不是数据集,是数据集里的每一份内容。台账至少要记录:来源类型、许可条款、获取日期、是否包含第三方再分发内容。做不到逐条追溯的,在诉讼中就没有位置。

第二,审计第三方数据集的来源链。这是索尼诉状里的第 3 项指控,也是最容易踩雷的一项。常见的情况是「公开数据集 → 抓取来的网页内容 → 未核查的第三方汇总」这样的三层结构,最底层往往完全没有许可信息。用了一个来源不明的公开数据集,不等于合规,只等于风险被推迟了。

第三,不要把「用途合理」当作数据获取的抗辩。这是 Bertz 判决最直接的应用。任何在内部讨论中写「因为我们是用来训练的所以没关系」的论证,在法律上都已经被这个判决否掉了。需要改成的是「这份内容是怎么拿到的」这个问题。

第四,注意版权管理信息(CEMI)这一项。索尼诉状里的第 6 项指控(删除版权管理信息)走的是与「实质性相似」不同的责任认定路径,举证成本更低。工程上的对应做法是:在数据处理流程中保留原始的版权声明与元数据,不要在归一化或清洗阶段丢弃。

第五,把「能生成相似输出」纳入风险评估。诉状的第 5 项针对的是模型输出能力。这意味着即使训练和获取环节都干净,模型本身具备生成实质相似内容的能力,仍可能被列为独立指控。对应的准备是输出侧的相似度检测与溯源机制——在产品上线前就具备「我的输出是否过于接近某部已知作品」的判别能力。

七、结语

2026 年的这批版权进展,把 AI 训练的法律边界推进到了一个相当清晰的位置:

Bertz 判决确立了「取得方式独立于用途」的原则,15 亿美元和解为 48 万部作品定了每部约 3,000 美元的价(约为常见单部处罚的 4 倍),而 2026 年 8 月 28 日索尼与华纳查普尔的新诉,则把这个原则从个案变成了诉讼策略——六段拆解、每件最高 15 万美元、主张故意侵权。

这批进展最重要的贡献不是让企业知道「训练 AI 侵权」,而是让企业知道了「哪一步会侵权」。这个区分极其关键,因为前者无法行动,后者可以。

可行动的版本是三条线:来源线(每一份内容怎么拿到的,必须可追溯)、过程线(复制与清洗环节是否保留了版权信息)、输出线(模型是否具备生成高度相似内容的能力且有无检测机制)。

而那个 900 万本量级的下载规模,是这一切的现实提醒:在训练规模以万亿 token 计的工程现实里,「逐本确认来源」是一个在操作上极其昂贵的要求。这个矛盾不会通过判决解决,只会被更多判决不断加码。对企业来说,与其等矛盾激化后再补救,不如从现在开始就把来源台账建起来——它是唯一在这批新规则下站得住的资产。