欧盟要求的 AI 水印,五年内都不会真管用
99.8% 掉到 9.7%。
这是马里兰大学和哈佛的人拿一种叫递归改写的攻击去打文本水印,打出来的检测率。原本一个几乎不会漏判的水印检测器,让改写模型来回揉几遍,就只剩下 9.7% 的真阳性率,而文本质量几乎没什么损失。论文在 arXiv 上挂着,编号 2303.11156,谁都能去翻。
七天后,欧盟《人工智能法案》第 50 条正式生效。里面白纸黑字要求,生成式 AI 的输出必须带上一个「有效、可靠、稳健、可互操作」的机器可读标记。
同一个东西,学术界这边说它一改写就没了,立法这边说它必须稳健。
我盯着这两行字看了半天,心情有点复杂。倒不是觉得欧盟在胡闹,恰恰相反,我觉得这条法规里有一半写得相当扎实。问题在于,所有中文报道都在转发同一句话,就是聊天机器人要自报身份、深伪内容要打标签,然后就没了。真正会让做产品的人在八月手忙脚乱的那部分,几乎没人讲。
坦率讲,我一开始也以为这事跟我没关系。欧盟嘛,隔着大半个地球。
结果翻到官方 FAQ 里那句域外效力的表述,我就不这么想了。
原话是,法案适用于「设立或位于欧盟境外」的提供者,只要其 AI 系统的输出在欧盟境内被使用。注意这句话的重心,不是你公司注册在哪,不是你服务器架在哪,是你的模型吐出来的东西有没有被欧洲用户用到。你在杭州的出租屋里写的一个 AI 写作工具,挂上 Stripe 收美元,有几百个欧洲用户在用,那你就在管辖范围内。
罚则是最高一千五百万欧元,或者上一财年全球总营业额的 3%,两者取高。中小企业适用比例原则,会往下调,但「往下调」不等于「不罚」。
好家伙,这一下就跟很多做出海工具的朋友有关系了。
先把这条法规到底管了什么讲清楚,因为大部分转发的稿子都糊在一起了。第 50 条实际上是四件互不相同的事,义务主体还不一样,有的落在提供者身上,有的落在部署者身上。
第一件,你的系统只要跟真人直接对话,就得让人知道对面是 AI。官方点名的是聊天机器人、AI agent、虚拟形象这三类。但它给了四个必须同时满足的条件才触发,分别是这玩意得构成一个 AI 系统、得是为真正的双向交流设计的、得是直接沟通不经人类中介、交互对象得是自然人。所以一个纯后台跑的模型不算,一个机器对机器的接口不算,一个只负责采集数据不回话的东西也不算。
法条留了个豁免,如果「这一点是显而易见的」就不用告知。很多人会想赌这个豁免,我劝你别赌。官方的口径是按「一个理性知情、审慎、细心的普通人」这个标准来衡量,并且因为它剥夺的是透明度,明确要求从严解释。你自己觉得显而易见,跟监管觉得显而易见,不是一回事。
第二件,生成式输出得打机读标记。这是今天的主角,一会儿单独说。
第三件,如果你部署的是情绪识别或者生物特征分类系统,得告诉被这套系统作用到的人,它正在运行。实时的、事后的都算。这条不要求你解释系统用来干嘛,只要求你说它存在。
第四件其实是两条,都落在部署者身上。一条是深度伪造内容必须在人首次接触时披露,一条是用来告知公众、涉及公共利益事项的 AI 生成文本必须明确标注。公共利益的范围列得挺长,公共行政与公共服务、司法与执法、基本权利、公共安全、公共卫生、环境保护、消费者安全,以及经济、财政、科学、文化领域的各种发展,基本上一个正经做内容的号写的东西,很难完全绕开。

这四件事我看下来,最能立刻动手、也最会被真正查到的,反而不是大家转得最欢的水印那条。
先把水印这事拆开。
法条对机读标记的技术要求是四个词,effective、reliable、robust、interoperable。有效、可靠、稳健、可互操作。这四个词单看都很正常,一个法条要求一项技术措施得管用,天经地义。
问题是 2026 年这四个词在生成内容标记这件事上,一个都不太站得住。
文本水印这边,前面那篇论文就是最直接的证据。递归改写攻击的做法很土,就是拿另一个模型把带水印的文本改写一遍,改完再改一遍,反复揉。水印方案在 1% 假阳性率下的真阳性率,从 99.8% 掉到 9.7%。9.7% 是什么概念,就是一百段确实由 AI 生成的文本摆在检测器面前,它只能认出不到十段。这个检测器已经没有使用价值了。
有人会说那是老论文,SynthID 出来之后不一样了。
不太一样,但也没好到哪去。后续研究里,当改写模型足够强的时候,SynthID-Text 的检测准确率同样会从接近完美掉到接近随机。更近期的工作报告了一组更难看的数字,条件性移除对其中两种方案达到了 100% 的成功率,对 SynthID 是 98.3%。就算不搞专门的攻击,只是把文本改写一遍再做一次翻译往返,SynthID-Text 的检测准确率也会从第一方环境下的 99.5% 掉到 75% 到 85% 这个区间。

75% 听起来还行是吧。你把它放到执法场景里想一想。四分之一的漏判率,意味着任何一个被查的人都可以说这段不是我的模型生成的,而你拿不出足以定性的证据。
更麻烦的是稳健性和质量之间那个死结。水印打得越重,越难被洗掉,但输出质量退化越明显。打得越轻,质量越好,越容易被改写抹平。到今天为止没有任何一个方案真正解决了这个权衡,大家都在这条曲线上挑一个自己能接受的点。
图像和视频那边靠 C2PA,情况是另一种糟糕。
C2PA 的思路跟水印不一样,它不是往像素里藏信息,它是给内容挂一份带签名的溯源清单,记录这东西是谁生成的、经过哪些编辑。技术上很干净,密码学意义上防篡改。
但它是元数据。
元数据会掉。截个图就掉了,上传到某些社交平台就被剥了,格式转换的时候掉,过一遍 CMS 也可能掉。这不是 C2PA 设计得不好,这是元数据这个载体的物理性质。微软自己在 2026 年 2 月那份《Media Integrity and Authentication》报告里说得很直白,阻止每一种攻击、或者阻止某些平台剥离溯源信号,是做不到的。
自家在推的方案,自家报告里承认防不住。我看到这段的时候笑了一下,不是嘲笑,是那种「行吧,至少你们诚实」的笑。
所以现在业界给的所谓最佳实践是双写,同一份内容既打不可见水印又挂 C2PA 清单。水印在元数据被剥之后可能还活着,C2PA 在没被剥的时候能提供完整的证据链。两个都不可靠,但两个同时失效的概率小一点。
这是个合理的工程妥协。它也确实不是「稳健」。
聊到这我得停一下,因为再往下写就容易变成一篇「欧盟不懂技术」的吐槽文,那就没意思了。我不这么认为。
我把官方 FAQ 从头到尾又读了一遍,读到一处之后改主意了。
法条把「机器可读标记」和「人可以感知的披露」拆成了两件完全独立的事,并且在深伪那一条里明确写了,部署者不能仅靠第 50(2) 条的机读标记来履行披露义务。
这句话我觉得很多人会读漏。它的意思是,你在图片里埋了 SynthID、挂了 C2PA,全都做了,在法律上你依然没有完成对深伪内容的披露义务。你还得给出一个自然人能理解、能感知的东西,一个看得见的标签,或者一段听得见的提示。
换个角度看,立法者其实知道机读标记这条腿是软的。所以他们又架了一条腿。真正能被普通人当场验证、也真正能被监管当场取证的,是那条人能感知的。
我的判断是,接下来一两年,实际的执法压力会绝大部分落在告知和标注这两层,而不是水印层。原因很简单,取证成本。查你有没有在聊天窗口第一屏告诉用户这是 AI,一个执法人员打开网页三秒钟就能确认。查你的水印稳不稳健,得做对抗测试、得请专家、得处理争议,谁都不想第一年就啃这块骨头。
这个判断对做产品的人是好消息,因为它意味着七天之内你真的做得完。
我把能在一周内落地的部分列一下,都是不用等技术标准就能动手的。
聊天类产品,在首次交互时给出清晰且可区分的告知,位置得显眼。官方在指南里明确点名了一种不可接受的做法,就是「藏在页脚里的一小段文字」。别耍这个小聪明。另外告知本身还得符合无障碍要求,屏幕阅读器读得到,对比度过得去。这块基本就是改几个组件的事。
如果你的产品会生成深伪性质的图片或视频,在用户首次接触内容时给可见标签或可听提示。深伪的判定有三个必须同时满足的条件,得跟被模拟对象高度相似、被模拟的对象得是存在或可能合理存在的、并且得有在真实性上误导人的能力。三条都占才算。纯风格化的插画、明显不指向任何具体存在的东西,通常不落进来。
有个例外挺重要,明显属于艺术、创作、讽刺、虚构这类作品的深伪,披露方式只需要「适当且不妨碍作品的呈现或欣赏」。做创意工具的可以松口气,但别把这条当万能挡箭牌。
内容类产品,如果你在批量生成涉及公共利益话题的文本并公开发布,要标注。这条有个非常关键的豁免,经过人工审核或编辑控制的文本不需要标注。官方对人工审核的定义是,由具备相关知识和专业判断的自然人对内容实质进行刻意的审查,学术同行评审、专业验证链这种级别。编辑控制则是由负责任的编辑主体在实践中行使的、能基于实质理由批准修改或拒绝文本的权限,包含事实核查和确保信源可信。
反过来,官方明确说了不算数的是「表面的、纯形式或程序性的检查」,例如拼写检查或语法纠正。
我读到这条的时候心里咯噔一下,因为这条基本上是在给所有「AI 生成加人工顺一遍」的内容流水线划线。你顺的是错别字,那不算人工审核。你顺的是事实和信源,那算。这个区别在合规上是天壤之别,在工作量上也是。
还有一件事很多人不知道,第 50 条的豁免清单其实挺宽的。明确不需要打机读标记的输出包括短的数字符号或字母序列、源代码、机器对机器且全自动处理完全不暴露给人的输出,以及封闭的工业和产品开发场景里的输出。另外 AI 只是执行「标准编辑的辅助功能」时也不需要标记。
源代码是明确豁免的。这一条对天天用 Claude Code、Cursor、Codex 写业务代码的人来说,等于直接出局,你 commit 里的每一行 AI 生成的代码都不用打标记。我第一次读到的时候还确认了两遍,确实写在那儿。
那机读标记这半条就完全不用管了吗,也不是。
已经在 2026 年 8 月 2 日之前投放市场的系统,机读标记这一项的合规期延到 2026 年 12 月 2 日,多给了四个月。八月二号之前生成的内容也不需要回头补标,官方鼓励但不强制。所以这件事的实际时间窗是四个多月,不是七天。
四个月够你把双写方案接上,够你在服务端把生成日志留全。我的建议是,与其纠结用哪家的水印,不如先把服务端的溯源记录做扎实。哪个请求、哪个模型版本、哪个 prompt、什么时间、给了谁,这些东西不会被截图洗掉,也不会被改写抹平。真到了要自证的那一天,它比埋在像素里的那点信号有用得多。
还有个偷懒的路子,签《AI 生成内容透明度行为准则》。这份准则委员会在 2026 年 6 月 10 日发布,是自愿性的,签了之后官方给的是「法律确定性、可预测性和信任」,并且不论你设立在哪、对口哪个监管机关。首批签署方的名单截止是 7 月 22 日,已经过了,但准则本身随时可以签。
不签的代价写得也很清楚,你得通过「其他适当方式」自证合规,并且会面临更多的信息索取要求。翻译成人话就是,不签也行,但被问到的时候你得自己举证,而且会被问得更频繁。
准则里还提了一个标准化的欧盟 AI 内容视觉标签,目前提案是「AI」两个字母,按语种本地化,德语用 KI,法语用 IA。分模态的建议是视频用持久标签、图像用可见标签、音频用可听声明。这套东西如果真的推开,可能会变成事实标准,值得提前留个位置。
说回开头那两个数字。
99.8% 和 9.7%。
我个人的赌注是,机读标记这半条法规在五年之内都不会真正管用。不是因为立法者傻,是因为它要求的那个技术属性和这类信号的物理性质是冲突的。你要一个能被任意二次加工、跨平台传播、还能被可靠检出的标记,这跟要一个泡在水里不会湿的东西差不多。我可能看走眼,欢迎五年后回来打我脸。
但我不觉得这条写进去是错的。
立法有时候干的就是这个事,先把要求立在那儿,逼着技术往那个方向跑。C2PA 这些年能推起来,跟监管的压力关系不小。你可以说这是先开枪再画靶子,也可以说这是给一个还没长出来的市场划了块地。
我更在意的是另一半。告知、披露、标注,这三层是人能感知的,是今天就能做的,是七天后真的会被查的。它们不酷,工程上也没什么难度,改几个组件、加几个标签、把内容流水线里的人工环节从改错别字提到核事实。
但这三层恰恰是这条法规里唯一真正保护到人的部分。一个人在跟客服窗口聊天的时候知道对面是机器,一个人在刷到一段视频的时候知道那是合成的,这些事跟水印的稳健性没有半点关系,跟界面上那行字有关系。
厉害了,绕了一大圈,最后管用的还是最土的办法。
七天。要做的事没多少,但得开始了。