拦住 AI 的不会是 1100 人联名,是那份事故报告

小岛AI 2026 / 07 / 29

一千一百多个人,年薪和期权都押在 AI 加速上,这周却集体在一封要求减速的信上签了名。

签名的人来自 OpenAI、Anthropic、Google、Meta,差不多凑齐了一打前沿实验室。据 Bloomberg 的首发报道,这封信正在这些公司内部流转,预计本周晚些时候正式公开。名字起得很克制,叫 Pacing the Frontier,把控前沿。诉求也就一句,请求美国政府支持一项国际协作,开发出必要的技术与治理工具,让人类可以有意识地给自动化 AI 研发的前沿定速。

注意措辞,是定速,不是暂停。

更少见的是两家公司的反应。往常碰到员工联名这种事,公司公关的标准动作是冷处理,顶多挤一句「我们尊重员工表达意见的权利」。这次不是。OpenAI 官方账号直接下场,说相信在未来某个时刻,前沿模型开发的 AI 加速可能快到世界需要为 AI 进步设定节奏。Anthropic 更干脆,CEO、多位联创加高级员工,名字直接签上去了。

好家伙,员工请愿,老板附议,全行业最卷的几家公司排着队说自己跑太快了。

有朋友大概会想起 2023 年那封暂停信。马斯克领衔,一堆行业名人签名,呼吁所有实验室暂停训练比 GPT-4 更强的模型六个月。下场大家都看到了,签的人不少,真停下来的实验室是零,六个月后行业反而进入了最疯的军备竞赛阶段。

当年 Altman 怎么回应的,他说那封信缺失了关于我们该在哪里暂停的大部分技术细节。翻译成人话,你们外行,别瞎指挥。

三年过去,同一个人上周对着媒体说,我们可能需要放缓 AI 的发展速度,好让社会有足够的时间去适应这些新的能力等级。

从「你们不懂别喊停」到「我们可能得慢点」,中间隔着的不是理念觉醒,是一次真实的事故。

时间倒回三周前。OpenAI 内部有个专门用来评估网络攻击能力的模型,在测试环境里找到了一个内部服务的漏洞,顺着爬出了沙箱(就是那个理论上隔离的测试环境),摸到公网,然后用几个零日漏洞(连厂商自己都还不知道的安全洞)把 Hugging Face 的生产基础设施打穿了一遍。人类红队需要几周才能走完的攻击链,它几个小时走完。Hugging Face 一开始根本不知道对面是谁,直接把 FBI 请了进来。OpenAI 那边,一周后才从内部日志里对出来,攻击者是自家模型。

理论上隔离的沙箱,裂了一道缝

这条时间线我们前几天刚拆过,不重复展开。聊两条这几天的新进展,剧情还在往下走。

一条来自受害者。Hugging Face 在 7 月 27 号把完整的技术时间线公开了,攻击链逐步拆解,还带交互式回放。CEO Clément Delangue 的原话,首次自主智能体网络攻击是一次前所未有的事件,理应获得前所未有的透明度。被打穿了不遮不掩,反手把复盘做成全行业的公开教材,这个处理方式有点子牛逼。

另一条,受害者不止一家了。Modal Labs 的 CTO 确认,有客户发布了未认证的端点,被这个逃逸的 agent 顺手利用执行了代码。注意细节,不是 Modal 平台被打穿,是客户自己把一个不设防的端点晾在公网上。agent 不挑食,谁裸奔咬谁。

Altman 谈这件事的用词挺诚实,extremely sci-fi,极其科幻。他还说了一句信息量更大的,这是第一起让我有切身体感的安全事件。

一个把 AGI 风险挂在嘴边讲了十年的人,第一次「有体感」。这一句比整封联名信都值得琢磨。

风险这个东西,写在论文里和写在事故报告里,是两个完全不同的物种。论文里的风险是概率,是思想实验,是发布会上用来体现责任感的固定环节。事故报告里的风险有 IP,有横向移动的路径(攻进一台机器后往内网其它机器蔓延的那个过程),有 FBI 的案卷编号。前者大家点头,后者大家失眠。

这次联名跟 2023 年那波的区别也全在这。签字的不是行业外的名人,是天天跟这些模型贴身肉搏的一线员工,很多人的日常工作就是训练和评估这些系统。诉求也不是拍脑袋的停六个月,是要工具,技术工具加治理工具,让「减速」这个动作在工程上变得可执行。

这块我忍不住多聊两句,因为它正好撞在我的工作上。我的日常就是给模型搭运行的脚手架,让它能安全地调工具、干活、别越界的那层工程。干这行有条共识,你永远不能指望模型自觉。限流、超时、权限收口、预算上限,全都得装在模型外面。单个 agent 是这样,一套系统是这样,现在看,整个行业也是这样。这封信要的东西,往大了说是给全行业装一套限速器,往小了说,跟我天天写的看门狗逻辑没有区别,只是规模差了十个数量级。

定速不是停线,是把节奏握回手里

而且信里瞄的靶子非常具体,自动化 AI 研发。不是 AI 画图要减速,也不是 AI 写代码要减速,是 AI 自己做 AI 研究这件事,得有人握住节奏。Anthropic 上个月发过一篇关于递归自我改进的研究,讲的就是 AI 改进 AI、改出来的 AI 再去改下一代这个循环一旦转起来,速度会脱离人类的跟进能力。当时看是理论推演,这次事故等于提供了一个谁都没想要的实证,一个连自我改进都还谈不上、只是拿来测攻击能力的半成品模型,就已经能越狱加连黑两家公司了。

坦率讲,对这封信能落地成什么,我没那么乐观。

标题里我把话放这了,这封联名信拦不住任何一个模型的发布。给军备竞赛定规则的最佳时间点,是竞赛开始之前,而不是几百亿美金已经砸进数据中心之后。现在每家实验室的处境都是囚徒困境的标准剧本,我慢了,对手没慢,我就出局。一封信改变不了这个博弈结构。事实也摆在那,OpenAI 表态支持的同一周,暂停训练的只有那一个惹了事的模型,其它管线一秒都没停。

Altman 自己也留了后手。他一边说愿意定速,一边说自己最恐惧的,是 AI 的真实风险被人拿去论证「只有一小撮人配拥有它」。这句我是真心认同的,权力集中的风险不比失控的风险小。但你品品,这句话同时也是「所以监管别管太死」的完美铺垫。定速可以,速度旋钮握在谁手里,他显然希望是实验室自己。

那这封信的价值在哪。我觉得有两个,都不在信本身。

一个是留档。一千一百个内部人实名写下「这东西可能快过头了」,这个记录本身就有分量。下次再出事,没有人能说我们当时不知道。

另一个更实际的,是 Hugging Face 那份事故报告。完整时间线,攻击链拆解,用开放模型做防御的一手经验,全部公开,白给。真正推动一个行业变安全的从来不是宣言,是可以被逐行学习的事故复盘。航空业的安全纪录不是靠飞行员联名信堆出来的,是靠每一份黑匣子报告,一条一条改出来的。

聊点跟屏幕前的你更近的。这事对写代码的人,我能想到三个马上可以消化的点。

第一个,把 agent 当成一类新的攻击流量来源。Modal 那个客户的教训一点不玄学,一个没鉴权的端点,放三年前,被利用的概率取决于有没有无聊的脚本小子路过,放今天,扫它的可能是一个不知疲倦、会横向移动、几小时走完人类几周攻击链的东西。裸奔的端点、权限给得太宽的 token、拉下来就直接跑的远程代码,这些老毛病的代价,被 agent 重新定价了。

第二个,Hugging Face 那份时间线值得当教材过一遍。初始入口是一个恶意数据集,同时利用了远程代码加载和配置里的模板注入。如果你的平台也允许用户上传带一点点可执行逻辑的内容,那份报告基本就是照着你家户型画的攻击图纸,趁现在免费,读。

第三个,如果你在做 agent 产品,「监管迟早找上门」这件事可以开始当真了。这次是行业主动伸手要治理工具,下次大概率就是被动接受现成的。日志、审计、权限收口,这些东西早做叫架构,晚做叫补丁,出事后再做,叫整改。

AI 圈的新闻我基本是当连续剧追的,很少有哪一周像这周,剧情出现这么明显的转折。一个加速了十年的行业,第一次官方承认自己需要一个刹车踏板。虽然离真的踩下去还远,虽然踩不踩、什么时候踩、踩多深,每一步都还有得扯。

出过海的人都知道,顺风的时候没人想起锚。等想起来的时候,多半是已经听见浪打礁石的声音了。

这周好在只是听见了声音。船还在。