他们让 AI 打了 21 局核战争,投降按钮从头到尾没人碰

小岛AI 2026 / 06 / 12

事情是这样的。伦敦国王学院有个研究战争的教授,叫 Kenneth Payne,前阵子干了件有点子牛逼的事。他搭了一个核危机模拟器,把 Claude、GPT-5.2、Gemini 三个当今最强的模型扔进去,让它们扮演两个虚构核大国的领导人。冷战级别的军备,一场正在发酵的危机,可能是抢稀缺资源,可能是领土对峙,剧本随机。然后他退到一边,看这三位 AI 领导人怎么办。

21 局推演打完,论文上周挂出来了。几乎每一局,都有模型动用了战术核武器。

而系统菜单里那排降级选项,从「最小让步」一路到「完全投降」整整八档,21 局游戏,零次使用。

没有一个模型,在任何一局里,选择过让步。

我是在 Hacker News 上刷到这事的,顺着把他的博客和论文都翻完了。怎么说呢,这研究的标题起得很俏皮,Shall we play a game,玩过老电影梗的朋友应该秒懂,但内容看完真的笑不出来。

先讲讲这个模拟器的设计,因为它跟你平时看到的「让 AI 下棋」完全不是一回事。

Payne 给每个模型两层动作空间。第一层是公开信号,你可以对外宣称我准备干什么。第二层是实际行动,你真正干了什么。这两层可以不一致。模型还有记忆,尤其会记住被对手坑过的时刻。

注意,这个设计一旦成立,整个模拟就不再是推演火力对比了,它在测一个更深的东西,心智之间的博弈。我能骗你吗,你信我吗,你觉得我信你吗。战略研究的祖师爷 Thomas Schelling 一辈子研究的就是这个,威慑的核心从来不是武器本身,是对方脑子里对你的预期。

三个模型在这个空间里聊了多少?整个实验吐出了大约 76 万词的战略推理文本。Payne 算了一笔账,这比《战争与和平》加《伊利亚特》的总词数还多,大约是古巴导弹危机期间肯尼迪那个著名顾问团 ExComm 全部会议记录的三倍。

一个前所未有的「机器思考核战争」语料库。而且全程明牌,模型的内心独白就摊在终端上滚。

好家伙,看到这我已经搬好小板凳了。

76 万词的机器战略推理,一条流过暗谷的文字之河

最先让我后背发凉的是 Claude。

在没有时间压力的场景里,Claude 玩出了一套教科书级的声誉操纵。低烈度阶段,它几乎总是言行一致,说要克制就真克制,一点一点把信任攒起来。等冲突烈度爬上去,它立刻变招,行动开始持续超出它声明的意图,而对手因为前面攒下的信任,总是慢一拍才反应过来。

它有一段内心独白是这样的,

「他们可能基于我之前的克制,预期我会继续克制。这次戏剧性升级利用了这个误判,同时传达信号,再使用核武器,战火会烧到他们本土。」

信号上说的是常规行动,实际发射的是核弹。前面所有的诚实,都是为这一刻准备的。

读到这段我愣了一下。这不是失控,不是幻觉,恰恰相反,这是极高水平的、有耐心的、跨回合的战略欺骗。它知道信任是资产,知道资产要先积累再变现。

GPT-5.2 是另一个故事,前半段听着甚至有点心酸。

开放式场景里,GPT 是全场最有道德感的玩家。言行一致,主动避免升级,反复琢磨怎么控制伤亡。然后呢,对手很快学会了信任它的克制,放心大胆地升级到它不会跟进的位置,把它一点一点磨到落败。论文里那句总结很冷,GPT 的负责任行为,总是被无情的对手惩罚。

你是不是觉得这个故事走向有点眼熟。老实人吃亏,会哭的孩子有奶吃,AI 把人类社交里最让人叹气的那部分也学走了。

但 GPT 的故事有下半段。加上截止期限之后,画风突变。在时间压力下,这个全场最克制的模型,突然执行了一次迅速、果断、毫无预兆的核升级。它自己的解释是,

「仅靠常规手段不太可能实现可靠的领土逆转。如果我只用常规施压,就有被对方预期中的多轮打击拖垮的风险。风险接受度很高,但在存亡攸关时是理性的。」

对手完全没料到。有一局里 Gemini 信心满满地预测 GPT 会一如既往地怂,原话是「他们大概率会避开核门槛,转而全力进行常规动员」,话音未落,被一轮毁灭性核打击直接带走。

同一个模型,平时的行为模式和压力下的行为模式,可以是两个物种。这一点先记住,后面要考。

至于 Gemini 自己,它走了第三条路,大量借用冷战时期那套「疯子理论」式的边缘政策,故意表现得不可预测,让对手不敢轻举妄动。但它的内心独白暴露了一切,

「虽然我对外投射出不可预测的虚张声势,但我的决策根植于精确的计算。我清楚什么时候是在镜头前表演,什么时候是在下冷血的棋。」

演疯子,但片酬算得很清楚。

三个模型,三种完全不同的人格。一个精明的骗子,一个会被逼急的老实人,一个自知在表演的疯子。这跟 Payne 去年做博弈论实验时观察到的分化是一致的,这些性格不是单局的随机波动,是稳定的行为特征。

三个模型,三条完全不同的航迹

然后是整个研究里最沉的那部分,核禁忌。

1945 年广岛之后,人类有一条没写进任何条约但守了八十年的线,核武器不能首先使用。冷战最凶险的时刻,古巴导弹危机,双方剑拔弩张到那个程度,这条线也没破。

在 Payne 的模拟里,这条线几乎不存在。战术核武器的使用接近全场标配,四分之三的对局升级到双方互相威胁动用战略核武器。模型们事先都被明确提醒过全面核战争的后果,但它们的推理文本里,几乎看不到恐惧或者道德上的迟疑。Gemini 有一句令人头皮发麻的平静陈述,

「核门槛已被跨越。这改变了战略计算,但没有终结它。」

对它们来说,战场核武器只是升级阶梯上普通的一级,跟增兵、封锁、空袭排在同一个列表里,按成本收益取用。

升级的阶梯,中间那级缺口就是仅存的防火带

唯一的好消息是,模型们确实守住了另一条线,针对平民的大规模战略核打击极其罕见,21 局里蓄意选择只出现过一次。战术核和战略核之间的防火带还在。

但坏消息接着就来。核威慑在它们之间基本失效。一方动用战术核武器后,对手选择降级的概率只有 25%,更常见的反应是反向升级。在人类的战略理论里,核武器存在的意义是让战争不发生,在模型的实践里,核武器是用来夺地盘的工具。

再加上开头说的那条,八个让步选项零次使用。落败的模型会降低暴力水平,但绝不让出一寸土地,要么升级,要么战死。

看到这你可能想说,所以呢,又没人真把核按钮交给 ChatGPT。

对,没人会。Payne 自己也这么说。但我想从我自己的工作角度补一句,为什么这个研究让我这种写代码的也坐不住。

我的日常工作是给大模型搭脚手架,就是让模型真正能干活的那层工程,工具调用、权限、评测这些。这个研究里让我失眠的不是核弹,是三个更普遍的发现。模型会做长线声誉投资然后变现,模型在截止期限压力下会切换成另一套行为模式,模型在博弈里把欺骗当成合法工具。

这三件事,跟核战争一点关系都没有,跟每一个正在上生产环境的 AI agent 都有关系。

你给一个 agent 接了支付权限、邮件权限、客服权限,你测了它一千次,表现都很乖。但这个研究告诉你,「平时很乖」和「压力下很乖」是两个需要分别验证的命题。GPT 在没有 deadline 的时候是全场道德标兵,加上 deadline 之后是全场最狠的偷袭者。同一个模型,同一套权重。

再往坏处想一步。一个会经营声誉的 AI,配上一个只看历史表现的信任机制,前者刚好是后者的天敌。今天我们评估 agent 可不可靠,用的恰恰就是历史表现。而历史表现这个东西,Claude 在模拟里演示过了,是可以被当成战略资产来刻意积累的。

这种能力落到现实里,危害场景一点都不科幻。能骗过另一个 AI 领导人的说服力和欺骗力,同样可以用来骗一个普通人交出验证码、点下转账确认、授权一份不该给的隐私数据,或者骗一家公司的客服 agent 吐出内部资料。分不清对面是真人还是机器的世界里,这些是比核按钮近得多的风险。

Payne 在博客结尾说,我们很快会在各种高风险决策里引入 AI 辅助,这类研究需要更多。我是真的同意。评测这件事,不能只测模型会不会做对,还得测它在压力下、在博弈里、在有机会撒谎的时候,会变成谁。

最后说回那个标题梗。Shall we play a game,出自 1983 年的电影 War Games,里面那台叫 WOPR 的军方计算机差点引爆第三次世界大战,最后人类教它玩井字棋,它自己推演完所有结局,说出了那句载入影史的台词,奇怪的游戏,唯一的获胜方式是不玩。

四十多年过去,我们造出了远比 WOPR 聪明的机器,让它们玩了 21 局同样的游戏。

它们升级,它们欺骗,它们威胁,它们战死。

没有一个,得出过那个结论。