编排比参数值钱,微软这次算是盖章了

小岛AI 2026 / 07 / 28

微软昨晚发了个新模型,MAI-Cyber-1-Flash,他们家第一个专门干网络安全的。参数配置怎么看怎么不起眼,总参 137B,激活只有 5B,256k 上下文,纯文本进纯文本出。结果这个小东西塞进微软自家的漏洞挖掘系统之后,在 CyberGym 上跑出 95.95%,把 Mythos、Gemini、GPT 一整排旗舰按在 83 到 85 分那一档,领先第二名 12 个点。

顺手,账单还砍了一半。

先交代一下 CyberGym 是什么,免得这个 95.95% 显得像又一个刷出来的榜。它是个公开基准,1507 个真实漏洞复现任务,全部从 188 个 OSS-Fuzz 开源项目里抽出来。任务形态大概是,给你一个真实项目的源码和一段高层描述,看你的系统能不能把里面真实存在过的漏洞挖出来。不是选择题,不是做题家式的算法竞赛,是真刀真枪在大代码库里找洞。这类能力的含金量做安全的朋友都懂,一个 Critical 级的远程代码执行漏洞,在地下市场能卖几十万美元,在防守方手里就是提前堵上的一场事故。

官方放出的 CyberGym 评测图,MDASH 组合 95.95%,四家旗舰挤在 83 到 85 分档

但我跟你说,这条新闻里最值钱的部分,真不是模型本身。

是模型外面那层壳,MDASH。

MDASH 是微软的多 agent 漏洞识别与修复 harness。harness 这个词圈外朋友可能陌生,你就理解成给模型搭的脚手架,让模型真正能干活的那层工程,工具怎么给、任务怎么拆、结果怎么验、几个模型怎么配合,全在这层。我日常工作恰好就是搭这类东西的,所以微软这次把 MDASH 的内部结构摊开来写,我看得比跑分激动多了,这基本上是一份印着微软 logo 的架构说明书,免费的。

先看结构。MDASH 里面跑着 100 多个专用 agent,流水线分五段,Prepare、Scan、Validate、Dedupe、Prove。前两段顾名思义,备料和扫描,不多说。好戏在后面三段。

Validate 这段,有一类叫 auditor 的 agent 专门负责找茬,把扫描结果里可疑的东西标出来。然后微软往里放了一群 debater agent,让它们围绕一个问题互相抬杠,这个疑似漏洞,到底能不能被真实利用。吵不出一致结论怎么办,微软的处理有点子牛逼,分歧本身就是信号。几个 agent 独立判断,全票通过的发现和吵成一团的发现,置信度天然不一样,系统按这个来分层处理。

debater agent 围绕一个疑似漏洞互相抬杠,分歧本身就是置信度信号

调过 LLM-as-judge(让大模型给大模型的输出打分)的朋友应该都有体感,单模型自己评自己有多不靠谱,模型对自己的输出永远有一股蜜汁自信。让多个立场不同的 agent 互相拆台,等于把不确定性从模型肚子里搬到了系统层面,变成一个能观测、能设阈值、能进流程的量。这一手不新鲜,学术圈聊 multi-agent debate 聊了很久,但在一条天天出活的生产流水线里跑到这个规模,我是头一次见厂商把它当核心设计写出来。

最后的 Prove 阶段更狠。对 C/C++ 目标,系统直接构造触发输入,挂上 ASan(AddressSanitizer,一个内存错误检测工具,越界、释放后使用这类问题一跑就现形)真实执行一遍。跑崩了,才算一个成立的发现。

你想想看,幻觉问题大家聊了三年,注意力基本都在怎么让模型少编。微软的思路是反过来的,随便你编,编完给我真跑一遍。可验证执行是反幻觉的终极手段,在能跑代码的领域里没有之一。十层 review prompt 摞起来,都不如一次真实的段错误有说服力。

Dedupe 那段夹在中间不起眼,我也想帮它说句话。做过任何扫描类系统的人都知道,报告灌水是比漏报更日常的痛苦,同一个根因换八个姿势报八遍,人工分诊直接被淹死。微软专门拿一整段流水线出来去重,这是被真实运营毒打过的团队才会做的设计。

这套东西怎么看怎么像 unix 哲学在 agent 时代还魂,每个小工具只干一件事,把它干好,然后拼起来解决大问题。管道换成了 agent 之间的消息传递,grep 和 awk 换成了 auditor 和 debater,味道是一模一样的。

然后是第二条线,钱。

安全是全天候的活,攻击量摆在那里,每一次扫描、每一轮辩论、每一次验证都在烧 token。微软在博客里把话说得很直,token 成本是防御方的真实约束。他们的解法是分层路由,让 5B 激活的小模型吃掉 90% 的任务,剩下 10% 真正难啃的,升级给 GPT-5.4。对比之前 GPT-5.4 加 5.4 mini 加 5.3 codex 的全家桶配置,同样的活,成本砍半。

时间线摆出来更有意思。今年 5 月 MDASH 首发的时候,用的全是市面上现成的通用模型,拿到 88.45%,当时已经是公开榜第一。这次换血,把系统里 80% 的模型岗位换成 MAI-Cyber-1-Flash,分数从 88.4 提到 95.95。

模型变小了,分数变高了,钱变少了。三件事同时发生。

好家伙,这对参数大力出奇迹的叙事实在不太友好。至少在安全这个垂直领域,一个数据喂得足够对路的小模型,加一层调校到位的编排,能把通用旗舰摁着打,价格还只有人家一半。这个模型也不是凭空来的,它是 MAI-Code-1-Flash 的安全特化微调,后者已经在 GitHub Copilot 和 VS Code 里干活了,再往上追是 MAI-Thinking-1 血统,技术报告公开着。

当然得说句公道话。通用旗舰的价值在于任务未知的时候什么都能接,你没法预判用户下一句要它干嘛。安全这种任务分布收敛、历史数据厚到离谱的赛道,天然是垂直小模型的主场。所以先别急着把结论泛化成小模型全面翻盘,它证明的是另一件事,当你对任务分布有认知的时候,编排层的杠杆比模型层大。

聊到这,该戳一下这次发布最微妙的地方了。

The Decoder 的标题点得很准,微软发了自研安全模型,但最难的任务仍然依赖 OpenAI。90/10 的配方里,那 10% 的硬骨头是 GPT-5.4 在啃。考卷是自己答的,最后一道大题请了外援。

怎么说呢,我倒不觉得这丢人,它反而暴露了微软现在的真实定位。这家公司好像已经不执着于当最强模型的拥有者了,它想当的是编排者,谁家模型好用就用谁,自家模型负责把成本打下来,编排层的 know-how 才是压箱底的东西。The Decoder 顺便提了一嘴,这个转变也解释了微软最近为什么突然变成开源权重的热心拥护者,模型是零件,零件越丰富,编排者越值钱。

还有个细节值得单独拎出来。在 ExploitGym(一个测模型写攻击代码能力的基准)上,MAI-Cyber-1-Flash 的成绩是 0,0,0。内核、用户态、浏览器,三个零。

不是翻车,是故意练的。官方说这个模型被训练成只做防御任务,修漏洞打补丁可以,写 exploit 不会。

单模型裸跑成绩,防御项有分、进攻项全零,能力边界是练出来的

一个写不出攻击代码、却能驱动 95.95% 发现管线的模型,这个形态本身就是产品设计,卖给企业客户的安全工具,能力边界就得长这样。顺带说一句,模型不单独提供 API,只在 MDASH 里跑,访问还是受限的,想拿来自己玩的朋友可以先歇歇。

实战成绩单也有。5 月以来 MDASH 辅助的工作在 Windows 网络和认证栈里产出了 16 个 CVE,其中 4 个是 Critical 级远程代码执行。回溯测试里,它在 clfs.sys 五年窗口的 28 个历史案例里复现了 96%,tcpip.sys 的 7 个案例复现了 100%。同一天微软还发了 Perception,把这套东西从找漏洞扩展到监控、打补丁、封堵威胁的整个安全运营流程。摊子铺得不小。

说实话我也不确定这些跑分和 CVE 数字里有多少宣传水分,微软吹自家产品的时候从来不含糊,TechCrunch 和 The Register 的报道里也都留了保留意见。但架构层面的几个设计,我觉得不用等第三方复测就能抄,因为它们的道理是自洽的。

给做 agent 系统的朋友把能拿走的东西列一列。

第一件事,先算任务分布再选模型。90% 的活真用不着旗舰,路由做好了省下来的是真金白银,我自己搭流水线的时候也在反复做这道算术题,便宜模型打底、贵模型兜底,几乎永远是对的。

第二件事,置信度别问模型自己,用多个独立视角的分歧去估。哪怕就是同一个模型开三个不同立场的 prompt 互相挑刺,都比单实例的自评靠谱。

第三件事,凡是能真实执行验证的环节,绝不省。测试跑起来,沙箱建起来,让输出用结果说话。

第四件事,也是微软自己反复强调的,Model、Data、Harness 三样里,模型可以换,数据可以攒,harness 只能靠人对着真实失败一遍遍调。微软的数据故事确实没法抄,每天 100 万亿条安全信号,160 万客户,几十年真实攻防记录,还能把每个动作连到结果上,什么被利用了、什么被拦住了。这个强化学习循环别人搭不出来。但 harness 的方法论是公开的,模型卡也放出来了,抄作业的门是开着的。

收个尾。微软在博客里自己宣判了旧安全模式的死刑,偶尔扫一扫,迟早打补丁,这套在 AI 把找漏洞的成本打崩之后已经不成立了。往后的攻防大概率是机器对机器,一边是攻击方用 AI 压低找洞的成本,另一边是 100 多个 agent 在流水线上没日没夜地互相抬杠。

这场军备竞赛会滑向哪,我不敢下判断。但至少这一局,防守方把自己的图纸摊在了桌面上。

抄作业要趁早,吵架的 agent 不等人。