告 AI 偷数据,13 个月连输三场,这条路怕是走不通了
先给你看两张账单。
第一张,美国的。Anthropic 因为拿盗版书库训练 Claude,去年 9 月法院批准和解,15 亿美元,覆盖约 50 万本书,平均一本赔 3000 美元,美国版权诉讼史上最大的一笔。
第二张,印度的。OpenAI 拿新闻社 ANI 的报道训练 ChatGPT,上周四德里高等法院宣判,不构成侵权,一分不用赔,临时禁令申请直接驳回。
同样是把别人的内容喂给模型,两张账单差了 15 亿美元。

这案子判在 7 月 24 号,英文圈这几天陆续出了分析,中文圈今天早上才开始刷。我今早通勤路上刷到,越看越觉得,值得聊的不是「OpenAI 赢了」这个结果,是它赢的方式,以及两张账单放在一起,露出来的那条全球性的裂缝。
先把案子本身讲清楚。
ANI,亚洲国际新闻社,印度最大的通讯社之一,2024 年 11 月把 OpenAI 告了,理由是 ChatGPT 未经许可存储并使用它的新闻报道做训练。这案子在德里高等法院走了 32 次听证,今年 3 月 27 日保留判决,7 月 24 日,法官 Amit Bansal 甩出一份 135 页的判决书。
法院框了四个问题。存储新闻拿去训练算不算侵权,用版权数据生成回答算不算侵权,这种使用算不算印度版权法第 52 条的合理使用,以及印度法院到底管不管得着。
判决核心就一句,OpenAI 存储 ANI 的作品用于训练大模型,落在第 52(1)(a) 条「私人或个人使用,包括研究」的豁免里。
训练,被认定成了研究。
有个细节我觉得比结论本身好看。ANI 其实赢了一个点,管辖权。法院明确说,训练发生在美国的服务器上,不妨碍印度法院管辖,想靠把机房放在海外躲开印度法律,没门。然后呢,法院当着你的面,判你实体败诉。先把人拽进门,再把门关上告诉你告不赢,这一手有点子牛逼。
还有一个点。ANI 主张商业公司不配用合理使用抗辩,你 OpenAI 一年几百亿美元营收,谈什么「个人使用和研究」。法院拒绝了,理由很立法技术流,议会在版权法其他条款里明确排除过商业使用,这一条没排除,那就是故意留的口子。商业身份不自动取消豁免资格。
至于 ChatGPT 的回答本身,法院看的是 RAG,检索增强生成,就是先去搜相关材料再组织语言回答的那套流程。认定是,输出和 ANI 原文不构成实质相似,而且 ANI 没能证明模型记住并原样吐出过它的报道。
最后是利益衡量。法官说禁令会对公众造成不可弥补的伤害,印度每周约有 1 亿人在用 ChatGPT。还补了一句更狠的,要是训练都得先拿许可,大模型开发会在经济上不可行。
单看这一个判决,你可以说这是一国国情,样本量为一,不说明什么。
但把时间轴拉长,画风就变了。13 个月,三场,出版方全输在训练这一端。
2025 年 6 月 23 日,美国,Bartz 诉 Anthropic,Alsup 法官判用合法获得的书训练模型是「极度转换性」的合理使用。两天后,Kadrey 诉 Meta,Chhabria 法官用更窄的理由,得出同样方向的结果。2026 年 7 月 24 日,德里,第三场。有出版行业媒体把这波总结成 13 个月内第三个重大裁决,并且直说,这是出版商迄今最弱势的位置。
好玩的是第三场的法律土壤完全不同。美国版权法 107 条是个弹性的四要素平衡测试,法官裁量空间很大。印度版权法第 52 条是一张穷举式清单,列了就豁免,没列就侵权,理论上对 AI 公司苛刻得多。结果呢,两套完全不同的法系,三个法官各自独立推理,走到了同一个地方。
训练端,没人愿意判死。

那 Anthropic 那 15 亿是怎么回事,前后矛盾吗。
不矛盾,这恰恰是整件事最值得看清的地方。Alsup 当时判的是,训练本身合法,但 Anthropic 的书有相当一部分是从影子图书馆下的,下载盗版这个动作,另算。15 亿赔的不是「拿书训练」,是「书的来路不正」。
所以美国路径的规则是,训练自由,但数据来路要干净。印度路径更进一步,存储加训练直接豁免,连来路都没怎么追。欧盟又是另一套,8 月 2 日 AI Act 透明度义务生效,训练数据要披露摘要,权利人可以声明退出。同一个训练 run,横跨三个法域,三种待遇。
我平时的工作是给模型搭运行的脚手架,就是让 agent 真正能干活的那层工程,训练数据离我这层不算近。但合规这东西,从来都是顺着管道往下流的,上游的判决迟早变成下游工程师 backlog 里的 ticket。这几个判决拼在一起,对写代码的人,我看至少有三个很实际的变化。
第一,举证的球被踢到了输出端。德里判决说得很清楚,ANI 输在没证明模型记忆和复述。以后出版商想拿到许可费,得先证明模型能原样吐出它的内容,这比证明「你爬了我的数据」难一个量级。反过来,对做模型的人,memorization,就是模型把训练数据背下来原样输出的现象,从一个学术话题变成了第一顺位的法律风险面。语料去重、版权文本过滤、canary 字符串检测这些脏活累活,以后不只是工程质量问题,是可能要上法庭对质的证据链。

第二,数据来路成了美国市场的生死线。同一份语料,正规渠道买的和影子图书馆下的,在 Alsup 那里是合法与 15 亿美元的区别。你的模型或产品要出海去美国,数据采购记录留好,爬虫的 robots 合规记录留好,这真不是律师吓唬人。
第三,也是我觉得最麻烦的,训练数据合规从此没有全球统一答案。在印度合法的事,在美国要看来路,在欧盟要看披露和退出声明。对大厂,这是养一个律师团队能解决的事。对小团队,坦率讲,大概率就是先按最宽松的来,做大了再说。这个策略的坑在于,法域是跟着用户走的,你的用户在哪,哪的法官就管得着你,德里这次的管辖权认定已经把话挑明了,服务器在天边也一样。
对了,案子其实还有后一半没判。ANI 另一项主张是 ChatGPT 编造报道然后冒充 ANI 出品,幻觉加冒名,这部分留到正式庭审。我反而觉得这一半对做产品的人更近身。训练端你可以说自己在研究,输出端你的模型顶着别人的名字胡说八道,没有任何豁免条款救你。OpenAI 当年的应对是直接把 ani.in 加进屏蔽列表,眼不见为净,工程上很诚实,法律上管不管用,庭审见分晓。
看完全案,我的感受有点复杂。
好家伙,1 亿周活用户,成了利益衡量里压倒性的砝码。用户量本身成了合法性的一部分,这个逻辑推到头是有点吓人的,做得够大,法院都得掂量禁你的社会成本。窗口期爬数据,长成巨头再谈判,这条被硅谷验证过无数次的路径,这次等于被法庭盖了个章。
但反过来看,出版商的律师也不会失业,他们只是要把起诉状从「你爬了我」改写成「你背下了我」。提取攻击,就是想办法让模型吐出训练原文的那类技术,会成为诉讼取证的标准动作。模型厂商的红队会把反提取测试当成上线前的必修课。法庭上的举证责任,最后都会落到工程师的测试用例里。攻防没有结束,只是换了阵地。
说实话我也不确定这个趋势会不会被哪个案子拐个弯,美国还有一堆没判完的官司悬着,谁也不敢打包票。但方向感是有了。
回到开头那两张账单。15 亿和 0 之间,隔的不是太平洋,是两个问题,数据怎么来的,模型背没背下来。至于训练这件事本身,全世界的法官,正在用各自的法条,给出同一个答案。
要说判断,我就留一个。以后看 AI 版权的新闻,别再盯「训练侵不侵权」了,这个问题基本收敛了。值得盯的是另外两条线,数据的来路,和输出的边界。海图上的暗礁没有变少,只是换了标注的位置。