OpenAI 把矛和盾交给了同一个模型

小岛AI 2026 / 06 / 23

事情是这样的。

这两天 OpenAI 扔出来一个叫 Daybreak 的东西,名字挺浪漫,黎明破晓,听着像哪个独立游戏的标题。但你点进去看里头装的料,会发现它干的事一点都不浪漫,甚至有点冷。

它把同一套最强的模型,同时摆到了棋盘的两边。一边教它怎么找出软件里的漏洞,找得又快又狠;另一边又给防守的人发一套工具,让你赶在坏人之前先把洞补上。攻和防,用的是同一个脑子。

我盯着这个发布看了好一会儿,第一反应不是兴奋,是「嘶」了一下。因为它把一件这几年大家心照不宣、但谁都没好意思说破的事,直接摊在了桌上。

我先把这事的来龙去脱给你捋一捋,再聊聊我作为一个天天给模型搭运行环境的人,看到这玩意为什么会愣那么一下。

网络安全的物理规律,被 AI 改了

OpenAI 自己在公告里有句话我觉得说得挺准,原文大意是,AI 改变了网络安全的物理规律。

这话听着玄,我用大白话解释一下。

过去几十年,找漏洞这件事是个稀缺手艺。你得对着一坨几十万行的 C 代码看到眼瞎,得懂内存怎么布局、指针怎么飘、攻击路径怎么一步步串起来,还得有运气。一个能在 Linux 内核里挖出严重漏洞的人,是真正意义上的高手,全世界也没多少。所以瓶颈卡在「找」这个环节,洞就在那,但没几个人有本事找出来。

现在不一样了。前沿大模型这两年在漏洞挖掘上的速度,是肉眼可见地往上窜。模型能在大型代码库里穿来穿去,能顺着攻击路径自己推理,能验证假设,能把那些藏得很深、人工要看一礼拜才能发现的安全问题给翻出来。

于是瓶颈就挪位了。

找漏洞不再是难事,难的是「补」。防守方现在被海量的漏洞报告给淹了。你想象一下,以前一个开源项目的维护者一个月收到三五个漏洞报告,还能挨个看。现在 AI 一扫,哗啦一下甩给你几千条,其中一大半还是误报的低质量噪音。你一个人,周末本来想陪陪家人,结果对着这几千条报告,连从哪条开始看都不知道。

这就是 OpenAI 想解决的问题。它说漏洞报告本身保护不了任何人,真正有价值的是后面那一长串动作,验证这个洞是不是真的、搞清楚影响范围、写出补丁、测试补丁、协调披露、帮团队把补丁部署上线。光找出来,屁用没有。

好家伙,这套逻辑我是服气的。因为它没有停留在「我们的模型能找到更多漏洞」这种秀肌肉的层面,而是承认了找出来只是万里长征第一步。

Codex Security,给每个程序员塞一个安全工程师

Daybreak 里第一个落地的产品,叫 Codex Security

它的产品设计理念其实一句话就能说清,就是想在每个写代码的程序员旁边,塞一个安全工程师。不是那种偶尔来 code review 一下的,是直接长在你 Codex 里、跟你一起干活的那种。

我先给不熟的朋友补一句背景。Codex 是 OpenAI 那个写代码的 agent,你可以理解成一个能自己跑命令、读代码、改文件的编程助手。Codex Security 就是给它装了一个安全插件。

这插件干的事不是简单地弹个警告说「这里有风险」。它会去理解你这个团队的代码和它的威胁模型,威胁模型这词儿听着唬人,其实就是「这套系统最怕被人从哪下手」的一张地图。如果你压根没有这张地图,它还能帮你生成一个。然后它去识别可能存在的漏洞,判断这段有问题的代码到底能不能被外部触发到,收集证据给你看验证步骤,写一个针对性的补丁,最后再自己验证一遍补丁有没有用。

整个流程里,人始终捏着方向盘。哪个漏洞要去查、哪个改动要应用、哪些信息能往外发,全是你说了算。模型只是把那些又脏又累的活儿干了。

讲讲数据。Codex Security 今年三月上线研究预览到现在,扫了超过三千万次提交,覆盖三万多个代码库。人工复核标记为「已修复」的发现超过七万条,自动判定已修复的超过五十万条。

五十万条。我看到这个数字的时候停了一下。

Codex Security 上线至今的扫描规模,三万个代码库、三千万次提交、五十万条已修复发现

这不是一个 demo 跑出来给你看个热闹的数,这是真有这么多漏洞被合上了。OpenAI 自己有句评价我觉得挺到位,它说这就是现在打补丁必须达到的规模。意思是漏洞产生的速度已经快到,你靠人工一条条修,是永远追不上的,补丁这件事本身也必须自动化、规模化。

新版插件还能接住外部扫描器、安全公告、漏洞赏金报告、工单系统里已有的那些发现,做分流和验证,然后批量生成补丁,把你积压了半年的漏洞 backlog 快速清掉。扫完之后还能导出到现有的漏洞管理系统,支持 SARIF 文件、CodeQL 查询这些业界标准格式。

说真的,作为一个天天跟工具链打交道的人,我最在意的恰恰是这个「能接进现有流程」的部分。一个工具再牛,如果它要求你把整个研发流水线推倒重来,那它在真实团队里基本是活不下去的。Codex Security 这一手,是想长在你已经有的东西上,而不是逼你搬家。这个分寸感,有点子东西。

GPT-5.5-Cyber,那个更猛也更敢说话的模型

Daybreak 里第二个重头戏,是一个叫 GPT-5.5-Cyber 的模型。

这模型的定位有点微妙,OpenAI 自己的说法是,它既更强,也更「permissive」。permissive 这词不好翻,大概意思是它在安全相关的任务上更愿意配合你,不会动不动就拒绝。

你大概也碰到过这种事。你想让模型帮你分析一段有漏洞的代码,结果它一看到「漏洞」「攻击」这些词,立刻进入安全模式,跟你说对不起我不能协助这类请求。对一个正经做防御工作的安全工程师来说,这种过度拒绝是真的烦。GPT-5.5-Cyber 最早的预览版,主要就是想解决这个,让它在专业的授权工作里别瞎拒绝。

这次更新更进一步,直接把能力也拉满了。

上数据,几个跑分我念给你听。

CyberGym 这个基准,测的是一个 agent 能不能在软件环境里复现已知漏洞。更新后的 GPT-5.5-Cyber 单模型评测拿到 85.6%,而普通的 GPT-5.5 是 81.8%。这是 OpenAI 测过的单模型最高分。

ExploitGym,这个更狠,它测的是 agent 能不能把已知漏洞变成真能用的 exploit、实现未授权的代码执行。GPT-5.5-Cyber 拿了 39.5%,普通版只有 25.95%。

还有 SEC-bench Pro,测长周期的漏洞发现和概念验证生成,针对的是复杂软件目标。GPT-5.5-Cyber 拿到 69.8%,普通版 63.1%。

我把这几个数放一起看的时候,心里其实是有点复杂的。

你注意到没有,ExploitGym 测的是什么?是把漏洞变成真能打的武器。这模型在这件事上的能力,从 25 个点直接干到了快 40 个点。我看到这条心里咯噔了一下。

我换个说法。这就是我前面说的那个「同一个脑子」的问题。一个能高效写出 exploit 的模型,和一个能高效补漏洞的模型,本来就是同一个东西。OpenAI 也很清楚这一点,所以 GPT-5.5-Cyber 不是谁都能用,它走的是一个非常克制的限定发布,只发给经过验证的、可信的防御方。普通防御者,OpenAI 建议你用 GPT-5.5 配上 Codex Security 就够了,那才是大多数人该有的起点。

这个分寸我后面单独聊,先把好玩的部分说完。

Patch the Planet,去给那些孤独的维护者搭把手

Daybreak 里我个人最有感触的,是一个叫 Patch the Planet 的计划。给地球打补丁,名字起得是真好。

这事是 OpenAI 跟 Trail of Bits 一起发起的,还拉上了 HackerOne 这些安全圈的老牌玩家。目标是帮开源项目的维护者,从「找到漏洞」走到「修好漏洞」。

为什么单独拎出开源?因为开源软件撑着这个世界的地基。你手机里的 app、政府的公共服务、你公司的开发工具、各种关键基础设施,底下都跑着一堆开源库。一个被广泛使用的网络库出了漏洞,下游可能有成千上万个系统跟着遭殃。

但你猜这些项目背后是什么样的?

OpenAI 引了一份哈佛和 Linux 基金会的研究,里头有个数字看得我心里一沉。在他们研究的那些被广泛使用的开源项目里,94% 的项目,一年里九成以上的代码,是由不到十个开发者写的。

不到十个人。

我脑子里立刻浮现出一个画面。某个网络库,全球几百万台机器在跑它,背后可能就是一个住在东欧某个小城的工程师,白天有份正经工作,晚上和周末用爱发电维护这个项目。他的 GitHub 头像可能还是十年前注册时随手设的。某天他打开邮箱,收件箱里躺着三千封自动化扫描器发来的漏洞报告,大半是误报。他看着这些,叹了口气,把笔记本合上,心想这事儿啥时候是个头。

被海量漏洞报告淹没的开源维护者,一盏台灯,一株刚冒头的代码分支

Patch the Planet 想解决的就是这个。它的核心不是甩给维护者更多报告,而是反过来,先帮你把活儿干掉。OpenAI 出钱请专业的安全研究员,给他们配上 Codex Security 和最强的模型,让这些人直接去跟开源维护者对接。每次合作都从一次沟通开始,维护者说清楚自己的优先级、偏好、已有的披露流程,然后研究员把整个事端到端管起来,在补丁送到维护者手里之前,就已经做完了验证和去重。

参与的项目还能拿到 ChatGPT Pro、Codex Security 的有条件访问权限,以及一笔 API 额度。目前已经有超过三十个开源项目承诺参与,第一批里有 cURL、Go、Python、Sigstore、还有 pyca/cryptography 这些你天天在用、但可能从没想过它们其实人手有多紧的项目。

第一个为期五天的冲刺,在多个项目里翻出了几百个待审问题,合并了几十个补丁,还有更多在路上。更细的复盘 OpenAI 放在了 Trail of Bits 的博客里,感兴趣可以去翻。

我是真的觉得这件事有温度。找到漏洞重要,但真正保护这个世界的,是把补丁落地,而落地这一步靠的是协作和社区支援。万能青年旅店有句词,是谁来自山川湖海,却囿于昼夜厨房与爱。我看那些开源维护者的时候总会想到这句,他们写的代码跑遍了山川湖海,自己却困在没人看见的深夜和无尽的 issue 列表里。能有人来搭把手,挺好的。

那个绕不开的问题,钥匙交给谁

聊到这你大概也品出来了,这事最拧巴的地方在哪。

同一套能力,给好人是盾,给坏人就是矛。OpenAI 整个 Daybreak 的设计,几乎所有的笔墨都花在了一件事上,怎么让这把钥匙只交到防御者手里。

它的原话是,前沿的防御能力不该被集中在少数人手里。软件渗透进了生活的每个角落,从关键基础设施到商业应用,防御者必须能民主地拿到这些模型,赶在攻击者发现并滥用漏洞之前,先去找、去修、去保护自己的系统。

听着挺正的对吧。但你细想,这里面有个绕不过去的张力。

如果防御能力必须民主化、必须人人可得,那攻击能力呢?同一个模型,你怎么保证它只长盾不长矛?

同一把钥匙要穿过层层验证才能交到防御者手里,它的影子既是剑也是盾

OpenAI 给的答案是分层。最猛的 GPT-5.5-Cyber 不公开发,只给验证过的可信防御方,还要配上更强的验证、监控、范围控制和人工复核。再往外一层是 Daybreak 合作伙伴计划,把 GPT-5.5 加上专门的可信访问权限,开放给一批安全厂商,让模型能力进到他们的产品里,但模型本身的直接访问权还是攥在合作方手里。

这批合作伙伴的名单也挺有看头,Cloudflare、CrowdStrike、Palo Alto Networks、Wiz、SentinelOne、Cisco、Okta、Darktrace、Akamai,安全圈你叫得上名的基本都在。

我盯着这套分层设计看,心里有两个声音在打架。

一个声音说,这做得对。能力越强,越不能直接撒到公开互联网上,分层、验证、人在环里盯着,这是负责任的做法。换我搭这套系统,我也会这么设计,宁可麻烦一点,也不能把核武器的发射钮做成网页按钮。

另一个声音说,可天底下没有滴水不漏的访问控制。验证机制能被钻、可信方会泄露、内部人会叛变。一个能力强到能在 ExploitGym 上拿 39.5% 的模型,一旦从任何一个缝里漏出去,它不会管自己被设计成是盾还是矛。

这两个声音我到现在也没调和明白,说实话我也不确定有没有标准答案。OpenAI 自己其实也没把话说满,它一直在反复强调人在环里、范围控制、协调披露这些词,这些词翻译过来就是一句话,我们也知道这玩意危险,所以我们想尽办法不让它失控。能做的它都做了,剩下的,是这个时代所有搞前沿能力的人共同的那道暗礁。

我作为搭脚手架的人,看到了什么

文章快收尾了,说点我自己的感受吧,可能不太成熟。

我平时的活儿,是给大模型搭让它能真正干活的那层工程,agent 的工具链、评测、调度这些。所以我对 Daybreak 这种东西,关注点可能和别人不太一样。我不太看它的发布会讲得多漂亮,我看它把模型摆在了什么位置上。

而 Daybreak 把模型摆在了一个特别诚实的位置上。它没有假装 AI 是个温顺的助手,它直接承认了这是一件双刃的事,承认了找漏洞已经不是瓶颈、补漏洞才是,承认了能力一旦到了这个量级,怎么分发比怎么训练更难。

这种诚实,在满天飞的 AI 赋能、AI 重塑、数据飞轮这些空话里,是稀缺的。我以前也信过那些大词,后来天天看模型在生产环境里怎么翻车,慢慢就不信了。一个东西到底行不行,不看 PPT,看它敢不敢把自己最危险的那一面也摆出来,然后老老实实告诉你我准备怎么管住它。

Daybreak 这次,至少把这一面摆出来了。

至于那把同时是矛也是盾的钥匙最后会交到谁手里,会不会有一天从某个缝里漏出去,我不知道。我猜 OpenAI 自己也不全知道。我们都在同一片海上往前开,前面有没有暗礁,得开过去才晓得。

能做的,是把灯打开。黎明破晓,Daybreak,这名字现在想想,起得是真有点意思。