法官批准 Anthropic 15 亿美元版权和解:AI 训练数据 piracy 的判例与行业影响

前言

2026 年 7 月 20 日,美国加州北区联邦法院法官 Araceli Martínez-Olguín 正式批准了 Anthropic 与作者集体在 Bartz v. Anthropic 一案中达成的 15 亿美元和解协议。这是美国历史上规模最大的版权集体诉讼和解之一,也是生成式 AI 行业在「训练数据从哪来」这一问题上,迄今最清晰的一次司法定调。

对开发者与 AI 从业者而言,这起案件的价值不在于「AI 公司又赔钱了」的标题党叙事,而在于法院把两条此前纠缠在一起的法律问题拆开了:用版权作品训练大模型,与从盗版站点批量下载这些作品,在法律上不是一回事。前者在 Alsup 法官 2025 年 6 月的裁定中被认定为 Fair Use(合理使用);后者则构成侵权,最终导向了这笔天价和解。

本文基于法院命令、AP、Ars Technica、Authors Guild 等公开来源,梳理案件脉络、和解条款与对行业的实际影响。

案件背景:Claude 的训练数据从哪来

Bartz v. Anthropic 由惊悚小说作家 Andrea Bartz、Kirk Wallace Johnson 等作者于 2024 年提起,指控 Anthropic 在开发 Claude 大语言模型时,未经授权使用了他们的版权作品。案件很快成为 AI 版权诉讼中的标杆——它挑战的是训练输入(inputs),而非模型输出是否复制了原作;原告并未主张 Claude 在回答用户问题时输出了侵权内容。

根据 William Alsup 法官 2025 年 6 月 23 日的 Fair Use 裁定(787 F. Supp. 3d 1007),Anthropic 获取训练数据的方式大致分为三类:

  1. 从盗版站点批量下载。2021 年 6 月,Anthropic 员工 Mann 从 Library Genesis(LibGen)下载了至少 500 万册盗版电子书;2022 年 7 月,又从 Pirate Library Mirror(PiLiMi)下载了至少 200 万册。Anthropic 明知这些来源系盗版。合计盗版下载超过 700 万册。
  2. 合法购买实体书后扫描。Anthropic 大量购入二手纸质书,拆封扫描, digitize 后存入内部「中央图书馆」(central library)。
  3. 使用 Books3 等已知数据集,其中包含约 18.3 万册作品。

Anthropic 的目标,用 Alsup 法官原话来说,是建立一座「世界上所有书籍」的中央图书馆,并永久保留。工程师再从这座库中选取不同子集,清洗、分词(tokenize)后用于各版本 LLM 的训练。

2025 年关键裁定:训练是 Fair Use,盗版下载不是

在批准和解之前,法院已经对核心法律问题作出分裂式(split)裁决,这也是理解 15 亿美元和解金额的关键。

AI 训练本身:Fair Use

Alsup 法官认定,Anthropic 使用版权书籍训练 Claude 及其前身模型,属于「高度 transformative(变革性)」的使用,符合美国版权法第 107 条 Fair Use 四要素分析,构成合理使用。法院特别指出,训练 LLM 并非向用户提供原书内容,而是学习语言模式与统计规律,用途与原作出版发行截然不同。

Anthropic 副法务总监 Aparna Sridhar 在和解获批后仍强调这一裁定:「训练 AI 使用书籍属于版权法下的合理使用。」对 AI 公司而言,这是迄今最有利的司法表述之一。

盗版下载与中央图书馆:侵权

然而,法院对从 LibGen、PiLiMi 下载并永久保存盗版副本给出了相反结论。Alsup 法官写道:从盗版站点复制教材的人「已经侵权,句号」(has infringed already, full stop)。即便这些副本日后可能用于 LLM 训练——而训练本身被认定为 Fair Use——获取和保留盗版副本的行为仍不能豁免。

法院进一步区分了合法购买后扫描的情形:用数字副本替换已购纸质书、仅供内部检索、不增加副本数量也不对外分发,属于 Fair Use。但「先盗版、后补买」不能抵消侵权:「后来为同一作品付费,并不能撤销盗版副本造成的损害。」

因此,案件进入损害赔偿阶段时,Anthropic 在「训练是否合法」上赢了,在「数据怎么来的」上输了——和解正是针对后者。

15 亿美元和解:条款与数字

2025 年 9 月,Alsup 法官初步批准了和解方案;他此后退休,由 Martínez-Olguín 法官接手并完成最终批准。和解主要条款如下:

  1. 和解基金:Anthropic 出资 15 亿美元(nonreversionary settlement fund),供符合条件的版权持有人申领。
  2. 单部作品赔偿:约 3000 美元/部(部分报道精确到 3351.39 美元),约为法定最低损害赔偿的四倍。Martínez-Olguín 法官认为这一比例「公平」。
  3. 覆盖范围:约 50.6 万部作品纳入集体诉讼范围;截至批准时,91% 以上的受影响作者和出版商已提交索赔,涉及 44 万册以上图书。
  4. 销毁盗版副本:Anthropic 须销毁从 LibGen、PiLiMi 等来源获取的盗版书籍副本;若和解后再次滥用相关作品,作者仍可另行起诉。
  5. 退出集体:350 名集体成员成功 opt-out,选择自行诉讼;法院驳回了绝大多数逾期退出请求(opt-out 截止日为 2025 年 3 月 30 日)。

律师费与原告奖励被削减

法官批准了 15 亿美元总额,但削减了部分分配:

  • 律师费:Class Counsel 原请求 1.875 亿美元(占和解金 12.5%),法院降至约 1.016 亿美元(约 6.8%)。
  • 三名 lead plaintiff 的服务奖励:从请求的 5 万美元/人降至 1.5 万美元/人,法官认为更高金额「不合理」。

若全部有效索赔支付后基金仍有结余, parties 预期将剩余资金二次分配给集体成员,除非经济上不可行。

为何是「史上最大」:与行业其他诉讼的对比

Authors Guild 与 AP 均称,这是已知规模最大的版权集体诉讼和解。Bartz 案也是数十起 AI 版权诉讼中第一起达成重大和解的主要案件——OpenAI、Meta、Stability AI 等仍面临类似诉讼,尚未走到同等规模的终局。

对 Anthropic 而言,和解意味着:

  • 锁定上限:避免损害赔偿庭审的不确定性(法定赔偿每部作品最高可达 15 万美元,700 万盗版副本的理论敞口惊人)。
  • 保留 Fair Use 胜利:训练合法性裁定不受和解影响,仍可作为先例引用。
  • 合规成本具象化:15 亿美元为「走捷径」标了价——行业此前对盗版训练数据的成本更多是声誉风险,现在是可计算的财务风险。

Lead plaintiffs 通过 Reuters 发表声明:「这让我们更接近 Anthropic 的真正问责,也向所有 AI 公司发出警告:不能走法律捷径,不能凌驾创作者权利之上。」

对 AI 训练数据合规的三条启示

结合 Bartz 案裁定与和解,AI 公司与数据工程团队至少应关注以下分工:

1. 「训练合法」≠「获取合法」

Fair Use 保护的是使用方式(transformative training),不自动洗白获取手段(piracy)。从 LibGen、PiLiMi、BT 站点、未授权爬虫批量抓取版权内容,即使仅用于内部训练,仍可能构成独立侵权。合规审查应拆成两道门:数据来源是否合法取得;取得后的使用是否符合 Fair Use——两道门都要过。

2. 内部「永久图书馆」放大风险

Anthropic 被认定侵权的核心行为,不仅是「下载了盗版书」,还包括长期保留作为通用研究资源。法院明确:即便 Anthropic 后来决定不再用这些盗版副本训练 LLM,保留行为本身仍不合理。数据团队若建设 central corpus,需有留存策略、来源审计与删除机制,避免「一次下载、永久持有」的模式。

3. 合法采购与授权许可仍是安全路径

Alsup 裁定对「购买实体书 → 扫描 → 替换存储」给了 Fair Use 背书,但大规模扫书仍有实操与合同限制(first sale doctrine 的边界、出版合同中的禁止扫描条款等)。更稳妥的路径包括:与出版商/集体管理组织签订训练许可、使用已获授权的数据集(如部分 academic corpus、出版社 partnership)、或合成/自建数据。Bartz 和解表明,省下的授权费可能以 magnitudes 更高的损害赔偿形式回来

结语:判例已立,行业未终

Martínez-Olguín 法官在批准令中强调,约 95% 的集体成员收到了通知,高参与率说明大多数作者认为和解「公平」。Anthropic 与作者 lawyers 都希望尽快分配基金、结束诉讼。

但对整个生成式 AI 生态,故事远未结束。Fair Use 训练论目前主要在 N.D. Cal. 的 Anthropic 案中得到支持,其他法院、其他诉由(如输出端侵权、DMCA、州法)仍待审理。欧盟 AI Act、各国文本与数据挖掘(TDM)例外等监管框架也在并行塑造合规边界。

对 Claude 用户和普通开发者,短期影响有限:Claude 产品不会因此下架,训练 Fair Use 裁定仍有效。对 AI 公司数据负责人,这是一次清晰的定价信号——15 亿美元买的是盗版数据的清算,不是训练本身的合法性否定。下一步,行业竞争的重点会从「谁能下到更多书」转向「谁能用合规方式构建足够大的语料库」,以及 Fair Use 判例在上诉与 sister cases 中能否站住脚。

参考来源

羽毛球分组比赛记分
小程序二维码

欢迎使用《羽毛球分组比赛记分》微信小程序

小夜