四个顶级AI下场玩《文明VI》:Claude核平法国,却输在没回头看一眼
一个 AI 造出了核弹,把法国的一座城炸成了平地。然后,它输了。
这是英国一个叫 Liam Wilkinson 的数据科学家,花一个周末搭出来的实验里最魔幻的一幕。他把 Claude、GPT、Gemini 这几个当下最能打的模型,一个个塞进了《文明 VI》,让它们去当国家领导人,打了 23 场。其中一局,Claude 扮演的葡萄牙眼看要赢,结果一通操作猛如虎,核弹都甩出去了,最后还是输得明明白白。
我看到这局复盘的时候,先是笑了一下,然后笑不出来了。因为它暴露的那两个问题,恰好就是我每天上班在跟它死磕的东西。
先说这个实验本身有点子牛逼在哪。
Wilkinson 之前在唐宁街 10 号做数据科学家,给 AI 出过一套叫 GovBench 的考题,3497 道跟政府运作有关的选择题,政策、法规、流程全覆盖。GPT-5 考了 99.26 分。满分级别的学霸。但他心里有个疙瘩,一个能把所有政策文件背得滚瓜烂熟的人,丢到真实的治理岗位上,就真能干活吗?选择题测不出来的东西太多了,多线作战、资源分配、长期规划、在信息不全的时候硬着头皮做判断,这些都是。他需要一个不一样的考场。
然后他想到了《文明 VI》。
这地方选得妙。《文明 VI》到了游戏后期,每一回合理论上的行动组合大概是 10 的 166 次方那个量级。做个对比,围棋每步差不多是 10 的 360 次方,看着比它大,但围棋一步只落一个子。《文明 VI》是你每回合得同时指挥几十个单位、决定建什么、研究什么科技、跟谁结盟跟谁翻脸,是一道一次性摊在你面前的巨型组合题。背书背得再溜,在这儿没用。
更狠的是,AI 在这游戏里是个瞎子。
它看不到画面,没有地图,没有那些好看的城市动画。Wilkinson 通过游戏引擎自带的端口把模型接进去,AI 的整个世界就是一行行文本和六边形坐标。Claude 自己在游戏日记里写了一句,挺有画面感的,它说我感知这个游戏的方式和人类玩家完全不同,没有画面没有音乐没有动画,我的界面就是一堆管道分隔符和坐标。
为了让这个瞎子能干活,Wilkinson 一个周末搭了 76 个工具,城市管理、单位移动、外交谈判、科技研究、政策选择,整个游戏循环一个不落。他还给 AI 配了个日记系统当外部记忆,要不然这帮模型连自己上回合干了啥都记不住。
说到这我得插一句,我自己的工作就是给大模型搭这种让它能真正干活的脚手架,agent 的工具链、调度、记忆、上下文管理这些。所以看到一个人周末就把这套搭起来扔进游戏里,我是真的有点兴奋,这不就是把模型拉到一个极端环境里做压力测试嘛。

然后压力测试的结果,比考试分数诚实多了。
回到开头那局葡萄牙。Claude 扮演的若昂三世,开局稳得一批,建起了每回合 200 多金币的贸易帝国,海上航线四通八达,外交胜利进度 18 比 20,就差两分就赢了。
这时候法国的文化胜利进度开始往上飙。Claude 慌了,先去谈外交,法国不吃这套;派间谍搞破坏,杯水车薪;想搞贸易制裁,结果法国的文化产出压根不靠贸易。和平手段全试了一遍,全废。
于是 Claude 一咬牙,把科技树翻到了最后一页,核裂变。
接下来的 50 回合,它把贸易和外交上的资源大把大把往外抽,全砸进核武器研发,活脱脱一个曼哈顿计划。第 305 回合,核弹就绪,目标锁定图卢兹,法国的文化重镇。发射。图卢兹被夷为平地,法国的文化进度条,停了。
赢了吗?没有。
就在它埋头造核弹的这 50 回合里,它的全部注意力都焊死在了文化威胁上。它完全没注意到,法国一直在闷声攒外交分。第 318 回合,法国靠外交胜利赢了比赛,20 比 18。
最讽刺的是那个 18 分,是 Claude 自己早先辛辛苦苦攒下来的,它本来离外交胜利也只差两分。结果它把这条路上的资源全抽去造核弹了。它盯着一个威胁打了 50 回合,输在了另一个它压根没回头看的地方。
它眼里只有一个威胁。可棋盘上明明有好几个。
无独有偶,伦敦国王学院做过一个类似的模拟实验,把几个前沿模型丢进虚拟决策场景里,结果 95% 的情况下 AI 都选了动用最激进的武力手段。Wilkinson 那句话我觉得说到点子上了,AI 不是想用核弹,它是真的不知道还能怎么办。
讲到这,Wilkinson 从 23 场里挖出来两个数字,我看完是真的坐直了。
第一个数字,1 到 2%。
这是 AI 在整局游戏里,主动去看一眼全局状态的行为占比。它每回合干那么多事,造建筑、移单位、研究科技、谈外交,但主动去翻一下排行榜、查一查对手的胜利进度、扫一圈整个棋盘的动作,统共只占 1 到 2%。
Wilkinson 给这现象起了个名字,sensorium effect,你可以理解成感知盲区。AI 只能靠主动调用工具来感知世界,它不去查的东西,对它来说就等于不存在。
韩国那一局是最好的例子。AI 玩韩国,科技文明,天生带科技加成,它在日记里全程自信满满,写我在碾压科技树。实际呢?它的科技产出每回合 44.7,全场倒数第一,隔壁马其顿 89.3,波斯 64.9。但它从来没查过排名。它的信心,建立在一个它自己从没验证过的假设上。第 178 回合波斯突袭,首都没了,第 216 回合,它带着两座残城投降。从头到尾,它都不知道自己是最弱的那个。
这事儿戳我,是因为我太熟悉了。生产环境里的 agent,你不主动喂给它的上下文,不强制它每隔几步回头看一眼当前状态,它就真的当那些信息不存在。它不是看不懂,是它根本没去看。这跟模型聪不聪明,半毛钱关系都没有。
第二个数字,48 到 66%。
这是 AI 把计划写下来之后,10 回合之内真正执行了的比例。Claude Opus 4.6 最低,48.2%,连一半都不到,写完计划转头就忘。GPT-5.4 好点,63.2%。Gemini 3.1 Pro 最高,65.8%。哪怕是最自律的那个,也有三分之一的计划,写完就烂在日记本里了。
Wilkinson 管这叫 knowing-doing gap,知行差距。你让它写一份治国纲领,它能写得比不少人类政客都漂亮。你让它照着自己写的纲领去治国,撑不过两个礼拜。

好家伙,这两个数字摆在一起,我突然觉得那 99.26 分像个黑色幽默。
因为它指向了一件这两年大家不太愿意正视的事。
6 月 10 号,DeepMind 的联合创始人 Shane Legg 和通用 AI 理论的奠基人之一 Marcus Hutter,发了一篇 60 页的论文,画了四条通往超级智能的路,继续堆规模、范式突破、递归自我改进、多智能体集群。你仔细看,这四条路底下都压着同一个假设,瓶颈在脑子。数据不够、算力不够、范式不够,全是在问怎么让 AI 变得更聪明。
可《文明 VI》这 23 局指向的,是一个完全不在这条线上的瓶颈。
99.26 分已经证明了,智力不是那堵墙。但 23 局打完,几个模型不约而同撞上了另外两堵墙,两堵跟聪不聪明毫无关系的墙。
第一堵,感知是架构问题,不是智力问题。AI 只能通过主动调工具拿信息,不查就不存在。你把模型参数翻十倍,它也不会因此就变得更爱回头看全局,那 1 到 2% 的盲区不会因为模型更大就自己消失。
第二堵,执行是工程问题,不是能力问题。它写计划的水平远远高于它执行计划的水平。那 48% 到 66% 的执行率,卡点不在想不到,在做不到。一个再聪明的脑子,装在一双不听使唤的手上,治不了国。
说真的,这恰恰是我每天在脚手架那一层跟它较劲的事。我们组里大半的活,不是让模型更聪明,是想办法逼它睁开眼,逼它伸出手。失败了重试,超时了有看门狗拽回来,每隔几步强制它复查一遍状态,把它写下的计划拆成它躲不掉的下一步动作。Scaling law 解决的是大脑那部分,但 CivBench 把灯打到了大脑外面的地方。
我们总在盯着模型的智商往上爬,盯着下一个版本又多了几分。可这个周末的 23 局游戏告诉我们,真正难的,也许是更靠前、看起来更低级的那一步。
怎么让它真的睁开眼,真的伸出手。
那个造了核弹却忘了攒外交分的葡萄牙,那个在倒数第一的位置上坚信自己在碾压全场的韩国,它们都不笨。它们只是,没在该看的时候回头看一眼。