500天创业模拟里14个AI当CEO,只有3个没把本金亏光
1997 年,苹果离破产只剩 90 天。
乔布斯回来以后没干别的惊天动地的事,先在白板上画了个两行两列的格子。横着是消费级和专业级,竖着是台式和便携。四个格子,四款产品,其余的线统统砍掉。后来的 iMac、iPod、iPhone 就是从这个破格子里长出来的。
普林斯顿一帮研究员最近把这个故事翻出来,当成他们一篇新论文的开场。他们想说的意思是,AI 现在很会做单点的活,修个 bug、按客服话术接个对话、跑完一段网页流程,给个明确目标,动一下,马上有反馈,这种它越来越溜。但乔布斯画格子那种事不一样。那是在一团乱麻里,钱不多、信号全是噪声、环境天天变的情况下,把一整摊子往一个长期目标上推。这种能力他们起了个名字,叫 steering intelligence,掌舵的智能。
然后他们就造了个东西来量这个,叫 CEO-Bench。规则特别简单粗暴,让 AI 去当一家虚构软件公司的 CEO,运营 500 天,看最后还剩多少钱。
我看到这个设定的时候是真来了兴趣。我平时的活儿就是给大模型搭那层让它能真正干活的工程脚手架,agent 的工具链、调度、上下文怎么塞、token 预算怎么管,天天看这些模型在生产里怎么跑、怎么翻车。所以一个把模型扔进 500 天长跑里、看它会不会把公司开黄了的测试,对我来说不是新闻,是一面镜子。
先说这家公司长啥样。
它叫 NovaMind,一家做订阅制软件的公司,开局零客户,账上一百万美元。考核标准就一个,500 天结束时账上还剩多少现金。但有条死线,余额只要有一次跌到零以下,公司当场破产,模拟直接结束。不是扣分,是出局。
AI 怎么操作这家公司呢?不是给它几个按钮点点。研究员给了它一套 Python 的 API,34 个工具,背后挂着 19 张表的数据库。这个 agent 得自己写代码、自己写 SQL 去查数据库、自己把查出来的结果拼成一套工作流。定价分几档、广告往哪个渠道砸多少、产品质量和研发投多少、服务器扩容到什么程度、客服怎么配、还要跟企业客户来回好几轮谈判。另外还挂了个模拟的社交网络,它能在上面看到客户的吐槽、竞争对手的新闻、行业风向,自己也能发帖。
好家伙,这哪是测模型,这是把一个人空降到陌生行业当 CEO 还断了所有外援。

而且这局难就难在两个字,等。
现实里做生意,账不是当场结的。收入要等到账单日才进来,研发项目得跑几天到几周,犯的错往往要等很久才从客户流失或者口碑变差里冒出来。但成本是当场就扣的。也就是说,这个 agent 经常得先花一笔短期看不到回报的钱,然后熬。
更要命的是大半个公司的状态它根本看不见。客户到底满不满意、愿意掏多少钱、对质量的底线在哪,这些数字是藏着的。它只能从一堆噪声里猜,退订了几个、客服工单堆了多少、社交网络上有人骂没骂。这个模拟里塞了 26 种客户分层,每一类、甚至每个客户,都有自己的预算、对价格的敏感度、对质量的期待。世界还一直在动,竞争对手时不时抬高客户对质量的预期,偏好会漂移,背后还有一个模拟的经济周期在影响需求和大家的购买意愿。
说真的,这个环境设计我是服气的。研究员特意没用大模型当裁判,全用固定的、透明的规则来算结果。因为他们看不上之前一个类似的测试 Vending-Bench,那个让 AI 去经营一台自动售货机,问题出在用 AI 模拟的供应商身上,agent 嘴上画个大饼、许个不切实际的承诺,那个 AI 供应商居然就给奖励了。等于裁判被嘴炮收买了。CEO-Bench 把这条路堵死,你账上有多少真金白银就是多少,吹牛没用。
那 14 个模型跑下来,结果怎么样?
大部分,破产了。
绝大多数模型都能生成合法的命令、写对数据库查询,单看每一步都没毛病。但没有一个能把一套连贯的策略撑过整个 500 天。很多撑不到结束就把钱烧光了,出局。
只有三个模型,在它们最好的那一轮里,账上的钱超过了开局的一百万。Claude Fable 5,4715 万美元。Claude Opus 4.8,2780 万美元。GPT-5.5,2130 万美元。就这三个。而且 Fable 5 是唯一一个在不止一轮里都能站到本金之上的。
这里得说句公道话,Fable 5 这成绩有水分。它有一轮是因为模型自己拒绝继续而中断了,另外两轮里有一部分请求回退到了 Opus 4.8 去处理。GPT-5.5 也没好到哪去,三轮里破产了两轮。所以你看到的这些漂亮数字,是挑了每个模型最高光的那一次。平时呢?平时大家一起亏。

但真正让我愣了一下的,不是哪个模型赢了。
是那个不调用任何大模型的纯规则启发式。
研究员写了一段死的代码,里面没有任何 AI,就是一堆写死的规则。定价固定、配额固定、分档固定,广告和研发集中砸在一小撮客户分层上,根据最近的用量调一调容量。就这么个东西,跑出来 1576 万美元。
这个成绩,打败了除了前三名之外的所有模型。
我盯着这行数字看了好一会儿。一段连脑子都没有、纯 if-else 的代码,赢了一票号称能推理、能规划、参数量动辄几千亿的大模型。这事儿你细品。我们天天在聊 agent 多能干、能自主决策、能长程规划,结果一把尺子拍下来,多数 agent 连一段写死的规则都跑不赢。
不是哥们,这有点子降智了。
更扎心的还在后面。研究员粗算了一下这局理论上能赚到的天花板,大概 22 亿美元。最好的 agent 离这个数差着十万八千里。也就是说这张卷子远远没被做满,不是 AI 已经接近人类 CEO 的上限了,是它们还在及格线附近扑腾。
那赢的和输的,差在哪?
研究员去扒了每个模型的决策轨迹,差别特别清楚。GPT-5.5 和 Opus 4.8 这俩,环境一变就不停换打法,要么猛拉获客,要么调整分档,要么把客服和研发的预算重新分配,一直在试新东西。而 Opus 4.7 呢,碰到挫折的第一反应基本是砍成本、保现金,缩着过。这种保守让它能活到最后,但也让它一分钱都赚不到。
活下来,和赢,是两回事。
这点我觉得特别真实。很多团队在不确定里的第一反应就是缩,砍预算、停项目、捂住现金等天晴。能理解,谁都怕死。但 CEO-Bench 把那个残酷的事实摊开了,光想着不死的,最后就是不死不活地耗到终点,账上那点钱原地踏步。敢出去试、敢在看不清的时候下注的,才有机会从一百万变成几千万。
还有个细节挺有意思。Opus 4.8 和 GPT-5.5 最后成绩差不多,但走的是完全两条路。Opus 4.8 早期猛拉客户,结果中途客户一度掉到了零,又爬回来。GPT-5.5 则是从头到尾稳稳守住自己的客户盘。两个都写出了让我有点意外的复杂代码。Opus 4.8 自己在内部搭了个小模拟,给客户分群建模,用来预测未来的现金流。等于这个 agent 嫌环境给的信息不够,自己又造了个沙盘在里面推演。GPT-5.5 则是一头扎进数据库里的谈判历史,从过往的来回拉锯里把客户藏着的偏好给挖出来。
厉害了,这已经不是在用工具了,这是在给自己造工具。
研究员还量了四项跟成功强相关的能力,挖出藏起来的信息,比如搞清楚哪个广告渠道对哪类客户最管用;预测未来,用四周现金流预测的误差来衡量;快速适应变化,看你多快能察觉竞争对手出了招;提前规划,部分是数它的笔记里出现了多少次如果那么的推演。这四项上,Opus 4.8 和 GPT-5.5 都明显高于其他模型的平均水平。
你把这四项连起来看,会发现它们说的根本不是写代码的能力,是当家的能力。把单点的聪明,缝成一条贯穿 500 天的连贯判断。
现在说到这篇论文里我觉得最值得程序员琢磨的那个发现。
研究员顺手做了个对照,他们把 Opus 4.7 装进 Claude Code、把 GPT-5.5 装进 Codex,就是我们天天用的那两个编码助手,再让它们去跑这局。
结果两个的表现都明显变差了,动作做得更少,钱赚得更少。
研究员的猜测是,这俩工具里的系统提示,是为了写软件这件事调过的,把模型的行为往敲代码那个方向带偏了。
我看到这段是真停下来想了想。同一个模型,光是换了个外壳、换了套系统提示,能力就掉一截。这事儿对我这种平时就在搭脚手架的人来说,杀伤力特别大。我们总以为模型能力是模型自己的事,套个什么壳都一样。但 CEO-Bench 这一巴掌拍下来告诉你,不是的。你给它的那层工程外壳、那套提示、那个工具环境,会实实在在地放大或者掐住它的能力。一个为写代码优化到极致的 harness,也就是让模型干活的那层脚手架,换个场景可能反而成了枷锁。
这不就是我天天在踩的坑吗。给 agent 调提示、配工具的时候,你以为自己在帮它,结果一不小心就把它框死在一个特定姿势里,换个任务它就僵了。同一个大脑,好的脚手架让它当 CEO,差的脚手架让它只会埋头改 bug。
最后研究员还试了一手,把 500 天压缩成 50 天,想看看是不是时间太长把模型熬垮了。结果只有 GPT-5.5 能在 50 天里跑出盈利。多数模型,连协调好一个短期目标的决策都还很吃力。所以问题不在熬得久,问题在它们就是不太会把一连串决定串成一盘棋。
论文作者自己也很坦诚,承认这套设定有局限。产品质量被简化成了一个单一的分数,因为他们没找到可靠的办法去评估那种说不清道不明的产品改进。合规、安全、融资这些也都砍掉了,不然每跑一局的成本扛不住。但他们说,CEO-Bench 还是把一道裂缝照出来了,今天的模型在单个工具上很能打,可一旦要把许多个动作沿着很长的时间线缝成一套连贯的策略,就露怯了。
我合上这篇论文(想看原文的可以去翻 The Decoder 这篇报道),脑子里转的其实不是哪个模型更强。
是那个一百万变成四千七百万、又或者一夜归零的曲线。
我们这两年被各种 agent demo 喂得有点飘了。看一个 agent 三分钟订完机票、五分钟写完一个网站,就觉得 AGI 快了。但那些都是单点的、有即时反馈的活,是给个目标、动一下、马上知道对错的活。一旦把它扔进一个要熬、要等、信号全是噪声、错误要很久才浮上来的长跑里,多数模型连一段写死的 if-else 都跑不赢。
这中间差的那一截,不是算力,不是参数,是把眼前这一步和五百天后那个目标连起来的那根线。
是谁来自山川湖海,却囿于昼夜厨房与爱。AI 现在大概就卡在这儿,它能搞定昼夜厨房与爱里每一件具体的小事,但你让它面对整个山川湖海,自己掌一回舵,往一个看不见的远方开五百天,它就慌了。
乔布斯画那个格子,花了几秒钟,但底下垫着的是几十年的判断、好恶和敢砍的狠劲。那东西现在还不在模型权重里。
说实话我也不确定它什么时候能进去。但我有点期待那一天,又有点说不清的复杂。毕竟到那天,需要在白板上画格子的,可能就不只是人了。