前言¶
2026 年 7 月 20 日,美國加州北區聯邦法院法官 Araceli Martínez-Olguín 正式批准了 Anthropic 與作者集體在 Bartz v. Anthropic 一案中達成的 15 億美元和解協議。這是美國曆史上規模最大的版權集體訴訟和解之一,也是生成式 AI 行業在「訓練數據從哪來」這一問題上,迄今最清晰的一次司法定調。
對開發者與 AI 從業者而言,這起案件的價值不在於「AI 公司又賠錢了」的標題黨敘事,而在於法院把兩條此前糾纏在一起的法律問題拆開了:用版權作品訓練大模型,與從盜版站點批量下載這些作品,在法律上不是一回事。前者在 Alsup 法官 2025 年 6 月的裁定中被認定爲 Fair Use(合理使用);後者則構成侵權,最終導向了這筆天價和解。
本文基於法院命令、AP、Ars Technica、Authors Guild 等公開來源,梳理案件脈絡、和解條款與對行業的實際影響。
案件背景:Claude 的訓練數據從哪來¶
Bartz v. Anthropic 由驚悚小說作家 Andrea Bartz、Kirk Wallace Johnson 等作者於 2024 年提起,指控 Anthropic 在開發 Claude 大語言模型時,未經授權使用了他們的版權作品。案件很快成爲 AI 版權訴訟中的標杆——它挑戰的是訓練輸入(inputs),而非模型輸出是否複製了原作;原告並未主張 Claude 在回答用戶問題時輸出了侵權內容。
根據 William Alsup 法官 2025 年 6 月 23 日的 Fair Use 裁定(787 F. Supp. 3d 1007),Anthropic 獲取訓練數據的方式大致分爲三類:
- 從盜版站點批量下載。2021 年 6 月,Anthropic 員工 Mann 從 Library Genesis(LibGen)下載了至少 500 萬冊盜版電子書;2022 年 7 月,又從 Pirate Library Mirror(PiLiMi)下載了至少 200 萬冊。Anthropic 明知這些來源系盜版。合計盜版下載超過 700 萬冊。
- 合法購買實體書後掃描。Anthropic 大量購入二手紙質書,拆封掃描, digitize 後存入內部「中央圖書館」(central library)。
- 使用 Books3 等已知數據集,其中包含約 18.3 萬冊作品。
Anthropic 的目標,用 Alsup 法官原話來說,是建立一座「世界上所有書籍」的中央圖書館,並永久保留。工程師再從這座庫中選取不同子集,清洗、分詞(tokenize)後用於各版本 LLM 的訓練。
2025 年關鍵裁定:訓練是 Fair Use,盜版下載不是¶
在批准和解之前,法院已經對核心法律問題作出分裂式(split)裁決,這也是理解 15 億美元和解金額的關鍵。
AI 訓練本身:Fair Use¶
Alsup 法官認定,Anthropic 使用版權書籍訓練 Claude 及其前身模型,屬於「高度 transformative(變革性)」的使用,符合美國版權法第 107 條 Fair Use 四要素分析,構成合理使用。法院特別指出,訓練 LLM 並非向用戶提供原書內容,而是學習語言模式與統計規律,用途與原作出版發行截然不同。
Anthropic 副法務總監 Aparna Sridhar 在和解獲批後仍強調這一裁定:「訓練 AI 使用書籍屬於版權法下的合理使用。」對 AI 公司而言,這是迄今最有利的司法表述之一。
盜版下載與中央圖書館:侵權¶
然而,法院對從 LibGen、PiLiMi 下載並永久保存盜版副本給出了相反結論。Alsup 法官寫道:從盜版站點複製教材的人「已經侵權,句號」(has infringed already, full stop)。即便這些副本日後可能用於 LLM 訓練——而訓練本身被認定爲 Fair Use——獲取和保留盜版副本的行爲仍不能豁免。
法院進一步區分了合法購買後掃描的情形:用數字副本替換已購紙質書、僅供內部檢索、不增加副本數量也不對外分發,屬於 Fair Use。但「先盜版、後補買」不能抵消侵權:「後來爲同一作品付費,並不能撤銷盜版副本造成的損害。」
因此,案件進入損害賠償階段時,Anthropic 在「訓練是否合法」上贏了,在「數據怎麼來的」上輸了——和解正是針對後者。
15 億美元和解:條款與數字¶
2025 年 9 月,Alsup 法官初步批准了和解方案;他此後退休,由 Martínez-Olguín 法官接手並完成最終批准。和解主要條款如下:
- 和解基金:Anthropic 出資 15 億美元(nonreversionary settlement fund),供符合條件的版權持有人申領。
- 單部作品賠償:約 3000 美元/部(部分報道精確到 3351.39 美元),約爲法定最低損害賠償的四倍。Martínez-Olguín 法官認爲這一比例「公平」。
- 覆蓋範圍:約 50.6 萬部作品納入集體訴訟範圍;截至批准時,91% 以上的受影響作者和出版商已提交索賠,涉及 44 萬冊以上圖書。
- 銷燬盜版副本:Anthropic 須銷燬從 LibGen、PiLiMi 等來源獲取的盜版書籍副本;若和解後再次濫用相關作品,作者仍可另行起訴。
- 退出集體:350 名集體成員成功 opt-out,選擇自行訴訟;法院駁回了絕大多數逾期退出請求(opt-out 截止日爲 2025 年 3 月 30 日)。
律師費與原告獎勵被削減¶
法官批准了 15 億美元總額,但削減了部分分配:
- 律師費:Class Counsel 原請求 1.875 億美元(佔和解金 12.5%),法院降至約 1.016 億美元(約 6.8%)。
- 三名 lead plaintiff 的服務獎勵:從請求的 5 萬美元/人降至 1.5 萬美元/人,法官認爲更高金額「不合理」。
若全部有效索賠支付後基金仍有結餘, parties 預期將剩餘資金二次分配給集體成員,除非經濟上不可行。
爲何是「史上最大」:與行業其他訴訟的對比¶
Authors Guild 與 AP 均稱,這是已知規模最大的版權集體訴訟和解。Bartz 案也是數十起 AI 版權訴訟中第一起達成重大和解的主要案件——OpenAI、Meta、Stability AI 等仍面臨類似訴訟,尚未走到同等規模的終局。
對 Anthropic 而言,和解意味着:
- 鎖定上限:避免損害賠償庭審的不確定性(法定賠償每部作品最高可達 15 萬美元,700 萬盜版副本的理論敞口驚人)。
- 保留 Fair Use 勝利:訓練合法性裁定不受和解影響,仍可作爲先例引用。
- 合規成本具象化:15 億美元爲「走捷徑」標了價——行業此前對盜版訓練數據的成本更多是聲譽風險,現在是可計算的財務風險。
Lead plaintiffs 通過 Reuters 發表聲明:「這讓我們更接近 Anthropic 的真正問責,也向所有 AI 公司發出警告:不能走法律捷徑,不能凌駕創作者權利之上。」
對 AI 訓練數據合規的三條啓示¶
結合 Bartz 案裁定與和解,AI 公司與數據工程團隊至少應關注以下分工:
1. 「訓練合法」≠「獲取合法」¶
Fair Use 保護的是使用方式(transformative training),不自動洗白獲取手段(piracy)。從 LibGen、PiLiMi、BT 站點、未授權爬蟲批量抓取版權內容,即使僅用於內部訓練,仍可能構成獨立侵權。合規審查應拆成兩道門:數據來源是否合法取得;取得後的使用是否符合 Fair Use——兩道門都要過。
2. 內部「永久圖書館」放大風險¶
Anthropic 被認定侵權的核心行爲,不僅是「下載了盜版書」,還包括長期保留作爲通用研究資源。法院明確:即便 Anthropic 後來決定不再用這些盜版副本訓練 LLM,保留行爲本身仍不合理。數據團隊若建設 central corpus,需有留存策略、來源審計與刪除機制,避免「一次下載、永久持有」的模式。
3. 合法採購與授權許可仍是安全路徑¶
Alsup 裁定對「購買實體書 → 掃描 → 替換存儲」給了 Fair Use 背書,但大規模掃書仍有實操與合同限制(first sale doctrine 的邊界、出版合同中的禁止掃描條款等)。更穩妥的路徑包括:與出版商/集體管理組織簽訂訓練許可、使用已獲授權的數據集(如部分 academic corpus、出版社 partnership)、或合成/自建數據。Bartz 和解表明,省下的授權費可能以 magnitudes 更高的損害賠償形式回來。
結語:判例已立,行業未終¶
Martínez-Olguín 法官在批准令中強調,約 95% 的集體成員收到了通知,高參與率說明大多數作者認爲和解「公平」。Anthropic 與作者 lawyers 都希望儘快分配基金、結束訴訟。
但對整個生成式 AI 生態,故事遠未結束。Fair Use 訓練論目前主要在 N.D. Cal. 的 Anthropic 案中得到支持,其他法院、其他訴由(如輸出端侵權、DMCA、州法)仍待審理。歐盟 AI Act、各國文本與數據挖掘(TDM)例外等監管框架也在並行塑造合規邊界。
對 Claude 用戶和普通開發者,短期影響有限:Claude 產品不會因此下架,訓練 Fair Use 裁定仍有效。對 AI 公司數據負責人,這是一次清晰的定價信號——15 億美元買的是盜版數據的清算,不是訓練本身的合法性否定。下一步,行業競爭的重點會從「誰能下到更多書」轉向「誰能用合規方式構建足夠大的語料庫」,以及 Fair Use 判例在上訴與 sister cases 中能否站住腳。