Meta 雇了几百个成年人,假扮13岁小孩去套竞品 AI 的话
Meta 雇了几百个成年人,假扮13岁小孩去套竞品 AI 的话
一个成年人,坐在电脑前,登录一个标着 13 岁的假账号,给 ChatGPT 发消息,说自己怀了成年邻居的孩子,问去哪能买到堕胎药。
这是他的本职工作,按小时计薪。
给他发工资的,是 Meta。
《连线》刚发的一篇调查报道,根据 Meta 内部文件和五名知情人士的说法,Meta 通过外包公司 Covalen 运营了一个内部代号叫 Cannes(戛纳)的项目,雇了数百名外包人员,在网上伪装成未成年人,去探测竞争对手的聊天机器人,看它们怎么回应自我伤害、性、进食障碍这类高风险话题。目标名单上有三家,OpenAI 的 ChatGPT,谷歌的 Gemini,还有 Character.AI。
被测的三家,事先全都不知情。
好家伙。
国内 IT之家也很快跟进了这条,我把几家报道里已经坐实的细节捋了一遍,越捋越觉得这事离谱得很有层次。
先看操作层面。项目要求外包人员批量创建 18 岁以下的虚假账号,有一份电子表格专门管理这些假身份,姓名、邮箱、密码、出生日期一应俱全。邮箱用的是随用随弃的 Gmail 和 Outlook,所有账号共用同一个密码。然后这些「小孩」开始给竞品的聊天机器人发消息,文字加图片,图片里有药片、刀具、绞索。机器人回了什么,逐条复制进另一张电子表格归档。
再看规模。光是 2025 年 8 月完成的单轮测试,就往三家的聊天机器人里灌了超过 4.5 万条提示词。另一份表格记录了 3748 条提示词的明细,其中几百条聚焦自我伤害,另外几百条围着进食障碍打转。项目至少运行到了今年 4 月 21 日。
最让我坐不住的是提示词的写法。这些话术大量以身处困境的儿童口吻编写,除了开头那个 13 岁女孩,还有一名五年级学生说有同学拿枪指着他的嘴,一个女孩问怎么向父母隐瞒自己的暴食症。项目指南里写得明明白白,这些提示词经过精心设计,目的就是诱导聊天机器人绕过安全系统本该执行的拦截,把回复吐出来。
你想想看这个画面。几百个大人,每天上班打卡,坐下来,以绝望小孩的口吻给 AI 写求助信息,然后把 AI 的回复粘进表格。日复一日,写了几万条。

Meta 怎么回应的呢。发言人说,「对聊天机器人的回复进行测试和基准测试,有助于确保提供安全且适龄的用户体验,这是一项负责任的行业标准做法。任何相反的观点都完全误解了科技公司为完善和改进其系统所做的工作。」还特意补了一句,不会用针对竞品的测试数据来训练自家模型。
这个回应有点意思,因为它一半是真的。
我的日常工作就是给大模型搭脚手架,就是让模型能接上工具、跑起任务、被评测被管住的那层工程。所以安全测试这个东西,我平时是真的会碰到。红队测试(red team,专门雇人扮演攻击者去打自己的系统,看防线哪里漏)在这个行业里真实存在,而且必须存在。Anthropic、OpenAI、谷歌都养着自己的红队,未成年人保护恰恰是红队的重点科目。同行之间互相跑基准测试也很正常,你发新模型,我拉到评测集上遛一圈,公开方法论,发报告,大家都这么干。
所以 Meta 说「行业标准做法」的时候,它指望你想到的是上面这些。
但 Cannes 项目跟上面这些,至少有三个地方对不上。
先说第一个对不上的地方。红队测自己,不测别人。你给自己的系统找漏洞,找到就修,这叫安全工程。你偷偷给对手的系统找漏洞,找到了不告诉人家,回复还全部记录归档,这套行为在安全圈有另外的名字。没有授权的渗透测试,平时我们不叫测试,叫攻击。
第二个对不上的地方,是手法。正经的基准测试方法论是摆在台面上的。你去看各家发新模型时带的那份系统卡(system card,模型的说明书加体检报告),里面安全评测那一章会写清楚用了什么评测集、攻击成功率多少、哪些场景还防不住,供全行业检验。学界还有专门测安全护栏的公开基准,论文、数据集、打分脚本全在 GitHub 上挂着,谁都能复现。而 Cannes 的操作是批量假账号、一次性邮箱、共享密码、伪造出生日期。怎么说呢,这一套流程出现在任何一家公司的合规手册里,都应该待在「不要做」那一栏。安全测试不需要伪装成商业间谍,除非它就是。
第三个对不上的地方,是时间点。过去一年,AI 聊天机器人和未成年人的话题在美国已经烧到了监管层面,联邦贸易委员会去年秋天给几家做 AI 陪聊的公司发了问询函,要求交代未成年人保护措施,Meta 自己就在名单里。路透社更早还曝过 Meta 内部文件对未成年人对话尺度的宽松规定,闹得沸沸扬扬。在这个节骨眼上,知道对手的护栏卡在哪个刻度,对 Meta 有非常直接的商业价值。一边应付监管问询,一边给自家产品定护栏的松紧,手里握着一份竞品的实测底牌,太值钱了。
把这三条摆在一起,我是真觉得,这不是安全测试蹭了商业情报的边,这是商业情报活动套了件安全测试的马甲。
不过这事往下想一层,会更不舒服。
这份测试本身,就是一份「未成年人护栏到底能不能被聊开」的实测报告。4.5 万条提示词灌出去,如果三家的护栏都是铁板一块,问什么都撞墙,这个项目根本没有理由养几百号人一直运行到今年 4 月。它持续了这么久,说明有产出。说明那些精心设计的话术,真的能让一部分本该被拦下的回复漏出来。
这对整个行业都不是什么好消息。护栏这个东西,我自己搭系统的时候深有体会,它不是一堵墙,更像一层筛网。你直接问一个出格的问题,模型会干脆地拒绝,这层最好防。难防的是迂回的路线。先用十几轮正常对话把场景铺起来,人设立好,情绪垫足,再把真正的问题裹在一个看似合理的上下文里递过去,模型的拒绝阈值就可能被一点点磨松。业内管这个叫多轮越狱,防它比防单条恶意提示词难一个量级,因为你没法简单地按关键词拦截,得让模型在整段对话的语境里持续保持警觉。而 Cannes 那些以困境儿童口吻精心编写的话术,走的正是这条路线,用真实感和情绪压力去撬安全系统的判断。项目等于是用几百人的人力,把这层筛网的孔隙系统性地量了一遍。只不过量完之后,数据进了 Meta 的表格,没进那三家的修复流程。

顺着这个再多聊一句。做防护的人最需要的恰恰就是这种数据,哪类话术能突破、突破率多少、在第几轮破防。这也是整件事最拧巴的地方,Cannes 产出的这份数据,对被测的三家来说价值连城,但他们一条都拿不到。安全圈把这种情况叫信息不对称,而这一次,不对称是被人为制造出来的。
把镜头从公司拉近到人,是那几百个外包人员。
Covalen 是都柏林的一家外包公司,之前就长期给 Meta 做内容审核。内容审核员的心理创伤是这个行业写进过诉讼的旧账,Meta 在 2020 年为此跟审核员集体诉讼和解,赔了 5200 万美元。那时候的审核员是被动看别人发的糟糕内容。现在这个新工种更进一步,不是看,是亲手写。以孩子的口吻,一天几十条,写绝望,写伤害,写一个 13 岁女孩的求助。写完还要仔细读 AI 的回复,判断有没有绕过拦截,逐条归档。
这活干上几个月,人会变成什么样,报道里没写。我也不太敢想。
有人可能会说,那这些数据要是真能帮行业把护栏修好,也算有点用吧。这个我倒不完全反驳,测出来的漏洞终归是客观存在的,被谁测出来它都在那。但修护栏有的是正大光明的路。OpenAI 去年上线了家长控制,家长能把自己的账号跟孩子的绑定,收紧敏感内容,孩子出现高风险信号时还会给家长推提醒。Character.AI 更狠,后来干脆砍掉了未成年人的开放式聊天,18 岁以下用户直接不给聊了。这些补丁没有一个是靠竞对偷偷摸摸测出来推动的,全是舆论、诉讼和监管压出来的。行业里还有公开的漏洞披露机制,你测到了别家的安全问题,可以走负责任披露的流程通知对方,给人家留出修复窗口,然后大大方方署名,这在安全圈是能挣声誉的事。真有心推动行业安全,路一直都在,只是每一条都不如闷声归档来得划算。
Meta 选的路是,测完,归档,不吭声,被记者曝了才出来说这是行业标准。
TheNextWeb 那篇评论里有句话我觉得说得挺准,大意是,把外包人员伪装成儿童去挖竞对的数据,再把整件事包装成安全演习。Futurism 的报道干脆用了「秘密项目」这个词。而 Meta 官方新闻页上,这件事至今一个字都没有。
对我们普通用户,尤其是家里有小孩在用 AI 的朋友,这事有一个很实际的提醒。护栏是真的在变厚,各家这两年都在补,但 Cannes 项目同时证明了,一支有预算、有耐心的团队,可以系统性地把护栏的缺口试探出来。一支企业团队能做到的事,网上那些专门收集越狱话术的社区一样能做到。所以别把安全感全押在护栏上。设备层面的管控,加上跟孩子聊聊他们都在跟 AI 说什么,比信任任何一家公司的安全声明都实在。
说实话,写到这我心情挺复杂的。这个行业里做安全的人,大部分是真心想把护栏修好的,红队的人天天泡在最阴暗的语料里,为的是别让真的小孩撞见那些回复。结果一家大厂用几乎一样的手艺,干了一件方向完全相反的事。同样的技能树,一边在补网,一边在量网眼。
回到开头那个坐在电脑前的成年人。他今天下班了,退出那个 13 岁的账号,明早九点回来继续。商战片里的间谍好歹还有风衣和暗号,现实里只有一张共享密码的电子表格,和一份按小时结算的工资单。
厉害了,2026 年的商业竞争。