最强模型被政府按住了:GPT-5.6 太会找漏洞,OpenAI 被叫停广泛发布

小岛AI 2026 / 06 / 26

一家公司把自己最强的模型憋出来了,结果不是开发布会,是被政府按住了肩膀,说,先别急着发。

不是因为它会胡说八道,不是因为它有偏见,也不是因为它算不清九块九的奶茶该找多少钱。

恰恰相反,是因为它太能干了。

6 月 25 日,Sam Altman 在 OpenAI 的内部 Q&A 上跟员工说,GPT-5.6 不会像以前那样一发就是全球开闸,而是先走一个受控预览,只给一小撮企业客户。随后那封内部备忘录里有一句更狠的,预览期内,哪个客户能用,要政府逐个点头。

我看到这条的时候第一反应是,好家伙,这剧本反过来了。

我们这几年看惯的故事是什么样的?是模型先发,全网用,出了岔子再来追责、再来开听证会、再来补丁。监管永远是擦屁股的那一方,跟在产品后面气喘吁吁地跑。这次不一样,这次是闸门还没拉,手就先被按住了。Axios 把这事的定性写得很直接,这是美国政府第一次在一个美国 AI 模型发布前,主动要求限制它上线(Axios 报道)。

第一次。这两个字分量不轻。

说真的,我盯着这条消息琢磨了挺久。倒不是因为它有多戏剧,而是因为它戳到了一个我天天在工作里打交道、却很少有人摊开讲的东西。我平时的活,简单说就是给大模型搭脚手架,让这玩意能在真实环境里干活、能调工具、能跑流程、能在翻车的时候自己爬起来。所以一个模型「能力强」到底意味着什么,我多少有点体感。一般人听到「模型变强了」,想到的是它写代码更利索、回答更靠谱、上下文记得更牢。但在我们这行,「能力」这个词是中性的,甚至有点凉。能力强,指的是它能自己把一件复杂的事从头干到尾,中间不用人扶。

而当这件复杂的事,是找漏洞、是攻进一个系统的时候。

嘶。你品。

先把事情的来龙去脉捋清楚,免得我在这儿干讲。

提这个要求的不是某个神秘部门,是白宫底下的两个实体,国家网络总监办公室(Office of the National Cyber Director),还有科技政策办公室(OSTP)。前者管的就是国家层面的网络攻防,后者管科技政策。商务部长那边也搭了句话,说没有跨机构的联合审批之前,别发。这阵仗你看着就知道,不是哪个官员一拍脑袋拦下来的,是几个口子凑在一起,认真地把这个模型当成一个需要管控的东西在对待。

它担心的到底是啥?一句话,GPT-5.6 在自动化网络攻防上的本事,太强了。

这里得给不在这个圈子里的朋友拆一下。所谓自动化网络攻防,拆成两半看。一半叫漏洞发现,就是在一大堆代码或者一个跑着的系统里,找出那个能被人钻进去的口子。这事以前是顶级安全研究员的手艺活,得人盯着、得经验、得灵光一闪,一个像样的漏洞挖出来可能要几周几个月。另一半叫漏洞利用,找到口子之后,写出真正能撬开门的那把钥匙,一步步打进去。

AI 厉害的地方在于,它把这两件原本高度依赖人的事,变成了可以批量跑、不知疲倦跑、一台机器复制成一千台跑的事。

而最关键的,是「无需人工介入」这六个字。

报道里提到,政府和 OpenAI 自己都认为,GPT-5.6 的能力跟 Anthropic 的 Mythos 是一个量级的。Mythos 这个名字小岛之前聊过,它能自己推进多步攻击链,能在没人帮忙的情况下定位软件漏洞。说得直白点,它不是一个给你打下手、帮你查文档的助手,它是一个能独立完成一整套攻击动作的东西。正是这个对标,让华盛顿那边拉响了警报。

我得诚实说一句,关于 GPT-5.6 本身的具体跑分,目前公开信息里是没有的。我们只能知道它「跟 Mythos 持平」,至于它在哪个基准上拿了多少分,OpenAI 没说,政府也没说。所以这篇里我不会给你编任何数字,谁要是跟你说 GPT-5.6 在某某网络攻防基准上多少分,大概率是脑补的。我们手里有的,就是「持平」这一个锚,和 Mythos 那点已经公开的攻防能力。

但就这一个锚,已经够让人坐直了。

为什么?因为漏洞这东西,是这个数字世界里最不对称的存在。

我跟你说个特别朴素的道理。一个防御方,要守住一个系统,他得堵上所有的洞,一个都不能漏。一个攻击方呢,他只需要找到一个洞。一个就够了。这就是为什么安全这行干起来这么累,你是那个要把一栋大楼所有门窗都焊死的人,对面是那个只要找到一扇没关严的窗户的人。攻防从来就不在一个天平上。

现在你把一个能自动找洞、还能自动写钥匙的 AI 扔进这个本来就不对称的局里。

它会帮谁?

理论上,它谁都帮。这就是这事最拧巴的地方,也是我觉得最值得程序员认真想想的地方。

你是个写代码的,你用这玩意扫自己的项目,它半小时给你列出十几个潜在漏洞,还附上怎么修。爽不爽?太爽了。这简直是每个被安全审计折磨过的后端的梦。我自己看到这种能力,第一反应也是兴奋的,这不就是我一直想要的那个东西吗,一个不知疲倦、不会漏看、还能给你讲清楚为什么的安全审计员。

但你把同样这套能力,原封不动地,交到另一个人手里。

同一把钥匙,能开你家的门,也能开你家隔壁那个小偷的门。它不挑主人。

这就是安全圈那个老词,双刃剑,dual-use,一个东西既能防御又能攻击,而且往往是同一套能力、同一个模型、同一行 prompt,区别只在于敲键盘的人想干嘛。漏洞发现能力强,意味着补丁能更快打上,也意味着 0day 能更快被批量挖出来卖掉。这两件事用的是同一种本事。你没法只保留好的那一半。

同一把钥匙,能开你家的门,也能开隔壁小偷的门,它不挑主人

我以前对这种「AI 太强所以危险」的说法,其实是有点不以为然的。觉得多少有点危言耸听,有点拿安全当噱头。毕竟这些年「AI 要毁灭世界」的论调听太多了,狼来了喊得耳朵起茧。但这次政府的反应方式,让我改了点看法。

因为他们没喊「AI 会觉醒」、「AI 会失控」这种科幻话。他们的动作特别具体,特别工程,特别冷静,就是逐个客户审批。

我第一次读到「逐个客户审批」的时候愣了一下。这是个什么治理方式?这根本不是我们熟悉的那套监管。以前的监管是定规则,是发牌照,是事后罚款。是一道一道的门槛,过了门槛你就自由了。而这个不是,这是把发布这个动作本身,从一个开关,变成了一个阀门。

开关是二元的,要么开要么关,发了就是全世界都能用。阀门是连续的,是流量控制,是这家企业可以、那家先等等、这个用途放行、那个用途按住。政府不是在问「这个模型能不能发」,它是在问「这一份能力,具体流到谁手里」。

这是一个我以前没怎么见过的形态。模型即基础设施,那它的发布就不再是一次产品上线,而更像是一次受管制物资的分发。你想想核材料、想想某些精密机床、想想加密技术早年的出口管制,是不是这个味儿。一个东西一旦被认为「足够危险」,它流向哪里这件事,就不再完全是生产它的公司说了算。

发布从一个开关,变成了一道逐客户放行的阀门

GPT-5.6 大概是 AI 第一次,被正式归到了这一类里。

我盯着这个细节,心里其实是有点复杂的。

一方面,我特别能理解 OpenAI 的处境。你辛辛苦苦、烧了天文数字的钱、把一个模型练到这个地步,结果不能发,或者只能挤牙膏一样一个客户一个客户地发。这对一家天天在跟竞争对手卡身位的公司来说,是真金白银的损失,是市场窗口的流逝,是憋屈。我要是那边的工程师,看着自己练出来的东西被锁在保险柜里逐个放行,心里多少得堵一下。

但另一方面,我又觉得,这种「被按住」,可能恰恰是这个行业开始长出理智的一个信号。

你看这几年我们是怎么过来的。一个新模型出来,所有人比的是谁发得快、谁的窗口大、谁的跑分高、谁先抢到那条热搜。整个行业像踩了油门下不来,谁慢半拍谁就出局。在这种气氛里,「先别发,我们想想后果」这句话是说不出口的,说出来就是给对手让路。所以大家心照不宣地一起往前冲,把「出了事再说」当成默认选项。

现在有一只手,从外面,硬生生把节奏给摁慢了一点。

我不是说政府管控就一定是好事,这里头的麻烦多了去了。谁来定义「足够危险」?这个审批权会不会被滥用?逐个客户审批,那审批的人懂不懂技术,会不会变成一个又慢又官僚的卡脖子环节?一家美国公司被这么管,那别的国家的模型不管,是不是反而把自己绑住了手脚?这些问题一个都不小,我也没答案。说实话我也不确定这条路走得通。

但至少,有人开始认真地把「这玩意可能很危险」当成一个需要动手处理的工程问题,而不是一句发布会上用来显得自己负责任的漂亮话了。

这点变化,对我们这些天天在底层给 AI 搭脚手架的人来说,其实是有实感的。

我多说两句这个实感。我的日常工作里,有很大一部分精力是花在「防止模型干它不该干的事」上。给它的工具调用加权限边界,给它的动作加确认环节,给它能碰到的东西画一个圈,圈外面的不许动。讲白话就是,你越是想让一个 agent 能干活,你就越得小心它能干的活的边界在哪。能力和约束,是一体两面,你给它松一寸自由,你就得在别处多焊一道栏杆。

GPT-5.6 这事,骨子里就是把我每天在一个 agent 上做的小事,放大到了整个国家的尺度。一个能自己干活的 AI,它的能力边界该划在哪,谁来划,划错了谁担着。我在我的系统里纠结的是「要不要让它有权限删这个文件」,他们在国家层面纠结的是「要不要让它有能力打进一个电网」。尺度差着十万八千里,但那个内核的问题,是一模一样的。

能力越强,约束就得越重。这不是反技术,这是技术成熟的标志。一个东西从玩具长成工具,再从工具长成武器,它要走过的,正是从「随便玩」到「得管管」的这条路。

回到我们普通人身上。这事跟你我有半毛钱关系吗?

有的,而且关系不小。

你不一定是安全研究员,你可能就是个写业务代码的,或者干脆不写代码,只是个每天用着各种 App、把工资卡和身份证号都交给了一堆看不见的服务器的普通人。但你想想看,当找漏洞、写攻击这件事的成本被一个 AI 打到地板上的时候,受冲击最大的是谁?

是每一个把自己的数据存在某个系统里的人。

以前一次有规模的攻击,背后得有一支懂行的队伍,得有人力、有时间、有成本,这成本本身就是一道天然的门槛,挡住了大部分小毛贼。现在这道门槛在变矮。当一个人凭一台机器、一个足够强的模型,就能把过去一支团队几个月的活,压缩到几小时跑完的时候,那些原本因为「不值得」而没人去碰的目标,突然就都变得「值得」了。

你公司内部那份没怎么设防的资料库,你随手注册的那个小网站存着的密码,你以为没人会专门来撬的那扇小门,在攻击成本趋近于零的世界里,全都暴露在外面。这跟政治没有半点关系,这是纯粹的、冷冰冰的资产安全问题。是你的钱、你的隐私、你的公司数据,会不会在某天,被一个根本不需要多厉害的人,用一个足够厉害的工具,给端了。

所以这事我看完,不是看个热闹。我是真觉得,那只把 OpenAI 肩膀按住的手,某种程度上,也是在替屏幕前的你我,多争取了那么一点点喘息的时间。让那把谁都能开门的钥匙,慢一点、再慢一点地,流到这个世界里去。

写到这儿我想起万能青年旅店那句,是谁来自山川湖海,却囿于昼夜厨房与爱。我们造出来的这些东西,本来是想让它替我们去趟山川湖海的,去算我们算不动的、去想我们想不通的。结果造着造着发现,最难的根本不是让它变强,而是在它变得足够强之后,怎么让它还囿于一个我们划得出来、也守得住的边界里。

GPT-5.6 最后会怎么发,受控预览要走多久,那道逐客户审批的阀门会拧得多紧,现在都还没有答案。Altman 说广泛发布大概在预览之后几周(The Information 原始报道,付费墙,其余媒体多为转述),但这个「几周」显然得看政府那边的审批脸色。

我会接着盯。倒不是盯 OpenAI 什么时候能放开,是盯这个「第一次」之后,会不会有第二次、第三次,会不会慢慢长成一套这个行业从来没有过的、关于「能力该流向哪」的新规矩。

毕竟,一个工具强到需要被批准才能交到别人手里,这本身就已经说明,我们造的早就不只是工具了。

棒棒的,又是一个让人睡前睡不太着的夜晚。