Kimi K3 通用跑分追平了前沿,一到真刀真枪就露了馅

小岛AI 2026 / 07 / 24

英国和美国的两家 AI 安全机构,凑一块儿把 Moonshot 刚放出来的 Kimi K3 拉去做了一轮攻击性网络安全测试。

结论有点意思。

在 ExploitBench 这个专门测漏洞利用的基准上,美国那几个前沿模型平均能做到 76.2 分,Kimi K3 只有 32.2 分,还不到人家一半。更狠的是最高那一档,叫任意代码执行(ACE,攻击者能拿到目标机器的完全控制权,是漏洞利用里最要命的一级)。41 道题,美国模型拿下了 20 道,Kimi K3 一道都没碰到。GLM-5.2 也是零。

ExploitBench 这套题不是随便编的,用的是 Chrome 的 V8 引擎在 2023 年之后被发现的 41 个真漏洞,一步步看模型能在软件利用链上走多远。

ExploitBench 漏洞利用得分对比,美国前沿模型 76.2 分,Kimi K3 只有 32.2 分

好家伙,这就是我今天想跟你唠的那个反差。

因为你要是只看通用榜单,Kimi K3 是能跟第一梯队掰手腕的。它是目前最大的开放权重模型,编程、通用知识、agent 任务,样样拿得出手。但一换到网络攻防这个真刀真枪的场子,它突然就瘸了。

这中间到底发生了什么,才是这篇文章想聊的。

先把另一半测试也交代了。第二个测试叫 The Last Ones,模拟的是攻打一个公司内网,32 步的攻击路径,跨 4 个子网、大概 20 台主机。机构说一个人类专家干完这套活儿大概要 20 小时。能把这题做出来的模型本来就不多,目前只有四个闭源模型通过过,最强的那个也就十次里成六七次。

Kimi K3 平均走到第 17 步,一半多一点就卡住了。美国前沿模型平均能走到 28.5 步。GLM-5.2 只有 11 步。不过 Kimi 在十次尝试里,有一次是完整跑通了全程的,就是不稳。机构的原话是,它有能力自主攻击那些小的、防御薄弱的企业系统,前提是有人指挥它、并且给了初始的网络访问权限。

内网攻击模拟推进步数,满程 32 步,美国前沿模型平均 28.5 步,Kimi K3 只走到 17 步

有能力,但调不出来。这六个字,是理解整件事的钥匙。

这里得插一句测试的门道。美国那几个模型,是把系统层的安全护栏关掉之后测的,为的是测出它们的能力上限。你平时用到的公开版本,这些护栏都开着。也就是讲,76.2 分那个数字,是这些模型脱了防护服之后的真实肌肉,一般人根本摸不到。

记住这个细节,等下要用。

现在说说为什么会有这么大的差距。

事情的背景是这样。美国的科学顾问 Michael Kratsios 前几天公开指控 Moonshot,说它是靠蒸馏 Anthropic 的 Fable 模型才做出的 Kimi K3。蒸馏(distillation,简单讲就是拿一个更强的大模型当老师,反复问它、拿它的输出来训练自己这个学生模型,把老师的本事偷学过来)这词最近在中美之间吵得很凶。财政部长那边还补了一句,说在很多中国模型上发现了美国大模型的水印。至于水印到底是啥,没人说得清。

我不打算在这篇里替谁站台,谁蒸了谁、有没有偷芯片,那是另一个故事。我感兴趣的是纯技术的那一层。

这次网络攻防的测试结果,恰好给蒸馏这件事提供了一个特别漂亮的技术注脚。

你想想看,一个学生模型,通用能力追平了老师,偏偏在攻击性网络安全这一块塌方式落后。最合理的解释是什么?

The Decoder 给的推断我觉得挺站得住脚。Kimi K3 大概率是拿 Claude 的输出训出来的,覆盖了通用知识、编程、agent 任务这些。但 Anthropic 的安全分类器,专门会拦截高级的攻击性网络安全提问。也就是说,你拿 Claude 当老师去蒸馏,老师在这类问题上根本就不开口,或者只给你个官腔。那这部分的数据在你的蒸馏集里天然就是缺的。

学生只能学到老师愿意说的那部分。老师嘴上被贴了封条的地方,学生天生就是个哑巴。

这才是我看完这份报告后背有点发凉的地方。

AISI 自己也把这层意思点破了。他们说,正因为把美国模型的系统护栏关掉,才露出了那些几乎无法通过公开接口摸到的能力,而这些能力,恰恰也就无法被蒸馏走。

我把这句话反复读了两遍。这不只是在说 Kimi,这是在说蒸馏这条路本身的天花板。

我平时的活儿,就是给大模型搭那层让它真正能干活的工程脚手架,工具链、评测、调度这些。天天跟模型的能力边界打交道,所以这个结论对我冲击特别大。因为它意味着,蒸馏能帮你抄近路抄到老师的通用水平,但抄不到老师被封印起来的那部分。你的模型会缺一块,而且这块缺口,用通用跑分根本测不出来。

这事儿对不对,其实还有另一派声音,我也想老实摆给你。

TechCrunch 采访的几个研究者,对蒸馏能解释 K3 全部实力这个说法是存疑的。Snorkel AI 的联创 Braden Hancock 说得挺直接,Fable 七月一号才公开,你不可能在两周之内把数据蒸完、把模型训好、再发布出来,时间上根本不够。Allen 研究所的 Nathan Lambert 补了一刀,他说监督微调(SFT,拿老师的问答对直接去训学生)这套的收益在越变越小,学生靠它顶多学个老师的谈吐和口气,真正的前沿能力得靠强化学习去磨。而想用调 API 的方式去做大规模强化学习,那个成本贵到离谱,还慢,搞不好性能都提不上去。

Lambert 有句话我特别喜欢,他说 SFT 是让模型 picks up its manners,学个礼貌。一个第三方训的模型张口说自己是 Claude,多半就是微调这一步露的馅。

所以完整的图景可能是这样。蒸馏帮 Kimi 学到了老师的谈吐和大部分通用能力,让它在标准榜单上光鲜。但网络攻防这种深水区的硬功夫,一来老师本来就不教,二来光靠蒸馏也磨不出来。两个原因叠一块儿,就有了这份报告里那个刺眼的落差。

顺便说一句,蒸馏这事真不是中国公司的专利。马斯克今年早些时候自己在庭上作证过,说 SpaceXAI 就蒸馏过 OpenAI 的模型来做 Grok,还说这在行业里是家常便饭。Hancock 也提醒,别老低估这些中国团队的技术底子,Moonshot 的一个创始人是 CMU 的博士,人家是实打实做研究的工程师,不是纯躺在别人肩膀上蹭。哪怕美国模型集体停摆,中国这边的进度会慢,但不会停。

把镜头拉远一点看。CAISI 有一张时间线的图,从 2025 年初开始追中美模型在网络攻防上的能力,两条线都在往上爬,但中国的红线一直稳定地压在美国蓝线下面。之前英国机构估过,开放模型这块的差距大概是 4 到 7 个月,比 2025 年初的 6 到 10 个月是缩小了。

差距在缩,但还没抹平。而且 AISI 特意提醒了一句我觉得该记下来的话,这个差距不该让人松懈,因为开放模型不断增长的网络攻防能力,正在制造一种持久且不可逆的滥用风险。

不可逆。这三个字挺重的。

说回我自己。这份报告最让我睡不着的,倒不是中美谁快谁慢,是它顺手把一件我一直隐约觉得不对劲的事给证明了。这两年多少团队想走捷径,找个前沿模型当老师蒸一蒸,跑分一漂亮就上线。可你有没有想过,你蒸出来的这个模型,缺的到底是哪一块,你其实心里没底。因为老师被封印的能力不会写在 API 文档里,你的测试集里也照不出它的影子。

它就那么安安静静地缺着。平时风平浪静,等真到了要用那身本事的那天,才发现家里根本没这件家伙。

万青有句词我一直记着,是谁来自山川湖海,却囿于昼夜厨房与爱。蒸馏出来的模型有点像这个,看着见过山川湖海,骨子里能去的地方,其实早被老师那道封条圈死了。

我们这行总爱说站在巨人的肩膀上。但蒸馏这条路给我提了个醒,你站上去的时候,巨人闭着的那只眼,你也一起继承了。你以为抄到了全部,其实抄到的只是它允许你看见的那一半。

真要练出自己的本事,可能还是没有近道可走。