Anthropic 赔了 15 亿美元,我觉得它是赢家
一个写惊悚小说的作家,把做出 Claude 的公司告到掏出 15 亿美元。
周一,旧金山联邦法院,地区法官 Araceli Martínez-Olguín 在裁定书上签了字,批准 Anthropic 与作家们的集体诉讼和解。48.2 万本书,每本约 3000 美元,总额 15 亿美元,原告律师管它叫「已知历史上最大的一笔版权追偿」。AP 的报道在这里,链接。
这两天中文圈的标题基本都是一个味,AI 公司偷书被罚 15 亿,大快人心。
我看完裁决相关的材料之后,得出的结论有点拧巴,甚至可能会挨骂。我觉得这 15 亿赔下去,Anthropic 不亏,往狠了讲,它可能是这场官司里最大的赢家。
别急着反驳,我把账摊开算给你看。
先讲这案子怎么来的。2024 年,惊悚小说作家 Andrea Bartz 拉着另外两位作者把 Anthropic 告了,理由是 Claude 的训练数据里有他们的书,没人问过他们,更没人付过钱。当时看这就是鸡蛋碰石头,一边是三个写书的,一边是融资融到手软的明星 AI 公司。
结果证据开示阶段翻出来的东西,把所有人都看沉默了。
法庭文件显示,Anthropic 从盗版站 Library Genesis 下载了至少 500 万本书,又从 Pirate Library Mirror 拖了至少 200 万本。700 万本盗版书,直接进了训练管线。不是模糊地带,不是灰色操作,就是从盗版站批量下载,跟大学生凌晨挂机下电子书是同一个动作,区别只是量级大了六个数量级。
好家伙,做前沿模型的公司,数据管线的起点是 LibGen。

到这里为止,剧情还是标准的爽文走向,坏人被抓包,赔钱谢罪。但这案子真正值得聊的部分,恰恰是大多数通稿一笔带过的那个转折。
2025 年 6 月,当时的主审法官 William Alsup 给了一个两头不讨好的裁决。他一方面认定,Anthropic 从盗版站获取图书这件事没得洗,该赔。另一方面他白纸黑字写下,用受版权保护的书籍去训练 AI,本身是合理使用,也就是版权法里的 fair use。他的原话是,用这些书训练 Claude 及其前身的行为「具有极强的转化性」。裁决报道在这里。
翻译成人话。看书学习不犯法,偷书犯法。模型读了你的书然后学会了写作,法院认为这跟一个作家读了一千本小说然后写出自己的小说,在法律性质上是一类事。真正要赔钱的,是「书是偷来的」这一个环节。
所以上周五出现了很魔幻的一幕。Anthropic 的副总法律顾问 Aparna Sridhar 发声明,重点强调的不是道歉,而是那项裁决表明「用书籍训练 AI 在版权法下属于合理使用」,语气里透着打赢了官司的松弛感。
一家马上要付出 15 亿美元的公司,官方口径是我们拿下了里程碑式的胜利。
你敢信,最离谱的是,从纯商业角度看,这个口径成立。
看看 Anthropic 躲掉了什么。美国版权法对故意侵权的法定赔偿,上限是每部作品 15 万美元。700 万本盗版书,就算法院最后只按零头判,数字也是天文级别的,理论上的风险敞口能到上万亿美元,够把这家公司清算几十遍。盗版部分原定 2025 年 12 月开庭,陪审团审理,生死未卜。

15 亿换掉一个万亿级的不确定性,还能分四期支付。对一家一年在算力上烧几十亿美金的公司,这笔钱大概相当于几个月的 GPU 账单。用工程的话讲,这不是罚款,这是一次性买断了整条数据管线的法律风险,顺便让法院帮你把 fair use 的边界焊死了。
再看作家这边拿到了什么。每本书约 3000 美元,而且这 3000 还要按出版合同跟出版社分账。一个写了三年的长篇,最后到手可能就一台顶配 MacBook 的钱。48 万本书里 91% 已经完成认领,说明作者们都来了,蚊子腿也是肉。真正拿大头的是谁呢,原告律所 Susman Godfrey 的战报已经挂在官网首页了。
我不是说作家们不该拿这笔钱,该拿,而且这是他们能拿到的最好结果了。Authors Guild 给作者们写的认领指南里说得很实在,走完诉讼未必比和解拿得多,还要再等几年。我只是想指出来,这场看起来作家赢了的官司,双方拿走的东西完全不在一个量级。作家拿走一笔一次性的小额支票,Anthropic 拿走一个可以永久复用的法律确定性。
说实话,这个结果我琢磨了挺久。
因为它戳破了过去几年 AI 圈一个心照不宣的默契,数据是免费的。爬虫开起来,管你是博客、论坛、电子书还是代码仓库,先进训练集再说。行业黑话管这叫「公开可用数据」,听着体面,其实很多时候跟 LibGen 的区别只是包装。
这次裁决之后,规则变清楚了。训练可以,白嫖不行,数据从此有了价格牌。
那问题来了,价格牌挂出来,谁买得起。
Anthropic 买得起,15 亿说付就付。OpenAI 买得起,跟各大出版集团和媒体的授权协议一份一份签。Google 更不用说,人家十几年前做 Google Books 的时候就把版权官司打了一轮。这次 Anthropic 自己也是这么干的,被抓包之后,它干脆雇来了 Google Books 图书扫描项目的前负责人,直接采购了几百万本二手实体书,拆掉书脊,整本扫描,原件销毁。一条完全合法的数据管线就这么用钱砸出来了,只是成本从「一个爬虫脚本」变成了「一个采购部门」。
现在换位思考一下,你是一个两三个人的开源模型团队,或者一家刚拿到天使轮的模型创业公司。这条合法管线你搭得起吗。搭不起。买书要钱,扫描要钱,授权要钱,打官司更要钱。
有点子讽刺了。一场旨在惩罚巨头的诉讼,最后给巨头修了一道新的护城河。以前拼算力,现在算力之外又多了一条,合法数据储备。规则清晰化的最大受益者,从来都是有钱守规则的人。
这也是为什么我说 Anthropic 是赢家。它不只是花钱消了灾,它花钱参与制定了行业规则,而这套规则对后来者比对它苛刻得多。这是几十起同类诉讼里第一起落定的重大和解,后面排着队的 OpenAI、Meta、Midjourney,法庭内外都会拿 Alsup 划的这条线当参照系。先付钱的人定义了价格,也定义了门槛。
最后聊聊这事跟你我有什么关系。你可能不写书,但你写博客,写公众号,往 GitHub 上推代码。这些东西大概率也在某个模型的训练集里,你我都没收到过 3000 美元。
按这次立下的边界,抓取公开发布的内容拿去训练,fair use 大概率罩得住,这条路短期内不会给普通创作者带来支票。但「获取方式必须合法」这条线是实打实立住了,绕过付费墙、破解、盗版站,这些行为以后每一件都有了 15 亿美元级别的判例压着。对写代码的人来说还有个值得留意的尾巴,开源代码有 license,license 是不是「合法获取」的边界之一,这个问题还没有一个 Alsup 来回答,我自己也说不好,但迟早会有人把它送上法庭。
回到 Andrea Bartz。2024 年她起诉的时候,大概没想过自己会成为 AI 版权史的一个注脚。现在案子结了,她的每本书能领到约 3000 美元。而她的下一本小说,几乎可以肯定还会被 AI 读到。
只不过这一次,书是买来的。这大概就是这场官司真正改变的全部,以及,不算少的一点点。