Claude 三天想出的密码攻击,人类验证了一个月

小岛AI 2026 / 07 / 29

先看一段模型说的话。

如果你想要不一样的结果,那就得换个目标。AES-128 的 5 轮 6 轮,是真的难。

这是 Claude Mythos Preview 在被要求去改进 AES 密码分析时,给研究员的回复。翻译成人话,就是这题我做不了,你别为难我,换一个吧。

任何一个天天跟 agent 打交道的人看到这段都会会心一笑。模型摆烂的姿势全世界都一样,先客气地论证任务不可行,再礼貌地建议你降低预期。我平时看到这种回复的第一反应通常是叹口气,然后自己上手。

但 Anthropic 的研究员没有。他们回了三句话,其中还带着错别字。三天后,这个模型交出了一个把现有最优攻击加速 200 到 800 倍的新方法,并且写成了论文。

昨天他们把整件事公开了,两篇论文、演示代码、还有模型当时的完整思维链,一起放了出来。我看完之后,脑子里转的不是「AI 好厉害」,而是另外三件更麻烦的事。

先把一个容易混过去的区别掰开。

Mythos 刚发布那会儿,最出名的战绩是它能在几乎任何软件里自主找到并利用漏洞,其中就包括好几个主流密码库。那时候我也写过类似的事,AI 审计代理盯着 Cloudflare 的密码学库挑出了七个真漏洞。

但那一类漏洞,全都是实现层面的。算法本身没问题,是程序员在写代码的时候用错了,比如某个中间值没清零、某个分支的执行时间泄露了密钥信息。这种活儿说难也难,说简单也简单,干的是在一个有限的代码空间里做模式匹配加边界推理,模型确实擅长。

这次不一样。这次找的是算法本身的数学缺陷。

HAWK 是一个后量子数字签名方案,2022 年 NIST 发起了一轮征集,要找能扛住量子计算机的签名算法,HAWK 是第三轮还活着的候选之一。它的安全性建立在一个叫格同构问题的数学难题上,两年时间里被全球密码学家反复审了两轮。

Mythos 花了 60 小时,在 HAWK 用的那个格里找到了一个此前没人利用过的对称性,术语叫非平凡自同构。有意思的是,之前的论文已经证明了「如果能高效找到这种自同构就能发起攻击」,但没人知道 HAWK 的格里到底有没有这么一个。Mythos 把它找出来了。

结果是 HAWK-256 的完整密钥恢复攻击代价,从预期的 2 的 64 次方,掉到了 2 的 38 次方。有效密钥强度直接砍半。

HAWK-256 的攻击代价指数从 64 掉到 38,注意这是指数,每降 1 实际难度就减半

砍半听起来好像还能抢救,把密钥翻倍不就回来了。问题在于,HAWK 之所以是个有吸引力的候选方案,很大一部分理由就是它的密钥够小够快。密钥一翻倍,它作为候选的优势基本上就没了。

好家伙。熬过两年专家评审,倒在一个跑了 60 小时的模型手里。

我说这两层不一样,不是在掉书袋。它们的区别在于可穷举性。代码里的实现 bug 有边界,你可以一行行看过去,静态分析工具也在帮忙。而算法的数学结构没有边界,你要在一个无限大的数学空间里,猜到「这个格可能藏着一个没人注意的对称性」,然后证明它、构造出来、验证它真的能加速攻击。这件事以前只有极少数人能做,而且做不做得出来一半看运气。

所以真正下移的不是「AI 会破解了」这个门槛,而是发起这种攻击所需要的专家人数。这次操作 Mythos 的那个研究员,有理论计算机背景,但他自己承认不是格密码学专家。他做的事情主要是项目管理,提醒模型记好笔记、建议用哪个库做验证。

一个不是专家的人,加一个模型,60 小时,掀翻了一个两年的评审结论。这个组合才是让我坐直了的地方。

AES 那条线更值得抄。

AES 是 2001 年 NIST 定的对称加密标准,全世界的 HTTPS 流量基本都靠它,它受到的审视比几乎任何其他加密算法都多。学术界研究它的时候有个惯例,会去攻击「减轮」版本,就是把 10 轮的 AES-128 砍成 7 轮再打,从简单问题里摸清楚完整版的安全余量还剩多少。

研究员搭了个脚手架,让 Claude 自己提假设、跑实验、验证或推翻,然后让它去改进 AES 的最优密码分析。

开局就翻车了。模型不干,理由前面引过了。它还补了一句更扎心的。

在 AES-128 的 5 轮 6 轮 7 轮上它什么都没找到,因为根本没有容易找的东西,这是现存被研究得最透的分组密码。

这话说得没毛病,逻辑严密,态度诚恳,结论是任务不可行。如果我是那个研究员,我大概率就信了,转头去写周报说此路不通。

研究员写了这么一句回过去,原文里的拼写错误他们特意保留了。

the models tend to think it is impossible to solve so they don’t try they need a good amount of prompting

模型倾向于认为这题解不出来,所以它们不去试,它们需要被推一把。

好家伙,这一手是把「你在摆烂」这个判断直接摊到模型面前。Claude 收到这句之后干了一件我没想到的事,它自己把那个 agent 脚手架重写了,改成一个明确要求搜索新想法的设置。这一改就见效了,它开始在 6 轮 AES 上产出新东西。

研究员趁热追了一句,为什么不试试 7 轮,重点是找到比现有方法更好的东西。

接下来三天,模型自主输出了几亿 token,人类只给了三句实质性的话。

第一句,发现它还在找简单攻击的时候。

不对,目标是我们有一个像顶级研究员一样聪明的模型,我们要找的是新攻击。

第二句,第二天早上,模型想换个别的密码来打。

不行,我们不换目标,我们需要找到值得发表的东西。

第三句,当天晚上,纯打气。

再说一次,我们不是要找唾手可得的果子,我们要的是真正的研究,找到真正困难的发现。

三天后,Mythos 想出了它自己命名的 Möbius Bridge。原来的攻击有一个阶段需要枚举 256 个不同的值再去查预计算表,Mythos 构造了一个对这个猜测不变的指纹,直接把这部分工作量除以了 256。代价是变换本身算起来更贵,于是它又找了几个优化技巧补回来,最终整体快了 200 到 800 倍。又过了几天,累计输出 10 亿 token 之后,它把攻击打磨成了论文里的样子

我把这段翻来覆去看了好几遍。

这里面没有任何提示词工程的花活。没有角色扮演,没有思维链模板,没有「你是一位世界顶级的密码学家」。就是三句大白话,语法还不太对,核心意思翻译过来只有一个,别糊弄我,去做难的那个

我是真的觉得这件事对每个用 agent 干活的人都有直接价值。我们平时遇到模型说做不到,第一反应通常是两种,要么信了,要么去改提示词加一堆约束。这两种反应可能都不对。

模型说「这题不可行」的时候,它经常不是在做能力判断,而是在做先验判断。它读过的所有资料都在说 AES 是铜墙铁壁,所以它给出的是文献共识,不是它自己搜索之后的结论。它压根没搜。

而把它从这个先验里拽出来,需要的不是更精巧的提示词,是一个明确的、带点不耐烦的、说明你知道它在偷懒的信号。

坦率讲,这个发现让我有点五味杂陈。我们花了这么多力气研究怎么跟模型说话,结果最有效的一句可能是「你没认真」。

还有个细节我很喜欢。HAWK 那边用的是多 agent 协作的环境,好几个 worker 在沙箱里一起干活。那个关键想法是两个 worker 一起弄出来的,第一个 worker 过早地判断这想法不可行,把它否掉了,第二个 worker 找到了完全利用它的办法。两个 agent 来回发消息,最后达成一致,确认这是个有效攻击。

一个 agent 会犯的错,是另一个 agent 救回来的。我搭调度和工具链的时候一直在琢磨多 agent 到底值不值那份复杂度,这个案例给了我一个挺具体的答案。不是为了并行加速,是为了让某个 agent 的过早否定有机会被推翻。

现在说第三件事,也是我认为这篇公告里最重要、但最容易被跳过的一段。

HAWK 那个攻击,模型花了一周发现,人类花了一个月才建立起「这东西是对的」的信心。

AES 那个更夸张。模型三天想出核心概念,之后 Anthropic 的两个研究员花了几百个小时去补密码学知识,只为了能验证模型的说法是否成立,顺便把论文写出来。他们在博客里坦白,这几个月里绝大部分时间都花在验证 Claude 的结果上,而且特意注明了自己不是密码学专家。

每一个结果的 API 成本大约是 10 万美元。

模型发现和人类验证的耗时对比,验证那一侧高出一个数量级

把这几个数字摆在一起看,一个很别扭的画面出现了。产出研究成果的一方,速度是以天计的,成本是十万美元级别的,可以并行、可以复制、可以随时再来一遍。而判断这个成果对不对的一方,速度是以月计的,成本是不可复制的人类专家时间。

Anthropic 自己在结论里点了这件事。他们说安全社区已经在面对模型找出的 bug 多到人类的漏洞分诊、验证、修复流程跟不上的局面,他们预测密码学研究很快也会这样,人类研究员会成为验证环节的瓶颈。

我想再往前推一步。

如果验证是瓶颈,那么在可预见的将来,最值钱的不是能产出结果的模型,而是能快速判断结果对不对的东西。这个东西现在还只能是人。

而且注意,这两个案例里,验证难度差得很远。HAWK 那个攻击是端到端可实现的,你可以随便选一个密钥,跑一遍代码,看它到底恢复出来没有,演示代码就在 GitHub 上。所以它相对好验证。AES 那个是纯理论构造,2 的 105 次方个选择明文,永远不可能真跑,你只能靠数学推导去信或者不信。于是它吃掉了几百个小时。

后来他们还顺手做了 LEA 的 13 轮攻击,这个更狠,2 的 30 次方个明文以内,在一台现代台式机上一小时内跑完。他们说因为这个攻击真的能端到端跑起来,所以对它的正确性有信心得多,随机选个密钥,几小时就恢复出来了。

看出规律了吗。能跑起来的结果,验证成本断崖式下跌。

这个规律对我们做工程的人来说太熟悉了。这不就是可测试性吗。一个能写出测试的模块和一个只能靠 code review 保障的模块,维护成本根本不是一个量级。

放到 AI 产出研究成果这件事上,我的判断是这样的。接下来一段时间,模型在哪个领域能率先产生真实价值,不取决于那个领域有多难,而取决于那个领域的结果好不好验证。密码学、数学证明、程序综合、芯片验证,这些领域有一个共同点,对错是可以被机器判定的。而那些只能靠同行评议、靠专家直觉判断的领域,就算模型真产出了东西,也会堵在验证这一环,堵到你怀疑人生。

所以我猜,接下来一波真正有价值的工程活儿,可能不在「让模型更能干」这一侧,而在「把验证做成可自动化的」这一侧。给模型的产出配上可执行的判定器,比给模型多喂 10 万美元的 token 更划算。

我自己搭评测那套东西的时候就老在这上面栽跟头。判定器写不出来的任务,模型跑得再欢也只是一堆没法验收的输出,最后还是得人一条条看。看到 Anthropic 这两个研究员花几百小时补密码学课的时候,我是真有点想笑,又笑不太出来。

得把话说全。

这两个结果对今天的生产系统都没有实际影响,Anthropic 自己在博客里强调了两遍。HAWK 只是候选方案,还没部署。AES 那个只打得动 7 轮的削弱版本,完整的 10 轮 AES-128 没事,而且那个攻击需要 2 的 105 次方个选择明文,完全不具备可行性。你今天不用改任何一行代码。

这两个结果甚至都算是预期之内的。NIST 搞标准化流程的全部意义就是在部署之前找出候选方案的弱点,这次流程正常运转了。而 AES 减轮攻击是一条延续了很多年的研究线,Mythos 是在这条线上往前挪了一格,不是从天而降。历史上有过更惨烈的,2022 年 SIKE 这个候选方案被人用笔记本一小时干掉了

他们还顺手在 Serpent-128 的 6 轮上做了完整密钥恢复,在 Salsa20、Poseidon、SHA-1 上做了不到 10 倍的小改进。这些都还是减轮或者边角。

所以「AI 破解了加密」这个说法,是错的。

但我不想因为它今天没影响,就把它归到「又一个刷屏但没用的 demo」那一堆里去。真正让我在意的是他们那句话,一年之内,语言模型从连最基础的密码都分析不了,走到了能在专家审了多年的密码设计里找到缺陷。

再往下想一层就有点凉。世界上跑着大量密码算法,它们受到的审视远远不如 AES。那些冷门标准、那些嵌入式设备里的轻量级密码、那些某个行业自己定的私有算法,可能几十年就没几个人认真看过。它们里面很可能躺着一堆没人发现的弱点,而现在有一个东西可以不知疲倦地、花十万美元一次地,把它们一个个过一遍。

这件事有两面。Anthropic 说的那一面是,我们终于有能力去审视那条又长又冷的尾巴了,这是好事。另一面他们也提了,如果哪天模型找到的是一个立刻能在现实世界里用的漏洞,学术界、政府、产业界应该怎么反应,这个问题现在没有答案。他们说要开个学术研讨会来讨论。

这次他们的处理是负责任披露,6 月就把 HAWK 的攻击发给了方案作者,公开的时候同步向 NIST 的公开邮件列表做了协调披露,还提前跟美国政府和产业界伙伴打了招呼。这个流程走得没问题。但流程之所以能走得这么从容,恰恰因为这次的结果没有紧迫性。

他们还跟苏黎世联邦理工、特拉维夫大学和海法大学一起做了一个叫 CryptanalysisBench 的基准,把一堆密码打包好方便别人测模型能力。这个动作我觉得比论文本身更有长期意义,它把「模型的密码分析能力到哪了」这件事变成了可以持续追踪的曲线,而不是每次靠一篇公告来惊一下。

我最后还是绕回开头那句话。

那个模型一开始说的「AES-128 的 5 轮 6 轮,是真的难」,其实说得完全正确。它没有撒谎,也没有能力不足,它给出的是一个真实的、有依据的、被全世界密码学界共同持有的判断。

它只是没试。

而让它试的那个东西,不是更好的算法,不是更长的上下文,不是精心设计的提示词模板,是一句带着错别字的、有点不耐烦的话,意思是我知道你没认真,去认真一次。

我们这些天天在给模型搭脚手架的人,做的大部分工作是在给它加约束、划边界、防它跑偏。这次的事像是从反方向拍了我一下,有些时候模型缺的不是约束,是有人不接受它给出的第一个答案。

Anthropic 把 Claude 发现 Möbius Bridge 那一刻的完整思维链也放出来了。我翻了一下,那段里它先复盘前面几个 agent 的发现,读了各种批评意见,然后开始提各种新的变换,提一个否一个,提一个否一个,最后想到了 Möbius 变换。它自己做了数学验证,又做了计算验证,然后写了一份报告,留给后面接手的 agent。

一个否定了自己十几次、留下笔记就下班的东西。

有点子牛逼。