Grok 4.5 私测于 SpaceX 和 Tesla,性能接近 Opus

小岛AI 2026 / 06 / 29

昨天半夜刷到马斯克一条推文,五百多万人看过了,就三行字,信息密度高得离谱。

他说 Grok 4.5 已经在 SpaceX 和 Tesla 内部私测了,基于一个 1.5T 参数的 V9 基础模型,补充训练里加了 Cursor 的数据,初步评估性能接近、或许超过 Opus。后面还顺手补了一句,今年 SpaceX 会每个月发一个完全从头训练的新模型。

我盯着这条推文看了一会儿,不是因为震撼,是因为这短短几句话里塞了至少五个值得单拎出来聊的点,而每一个点单独拿出来都够发一条新闻。马斯克这人写推文一向是这样,把一堆重磅消息压缩成一句顺口的话,留你自己慢慢拆。那今天我就跟你唠唠,这条推文里到底哪些是真有料的信息,哪些是听个响就行的营销话术。

先把丑话说前面,原始素材就是这一条推文(原文在这),没有技术报告,没有 benchmark 截图,没有第三方复测。所以下面凡是我往外延伸的部分,我都会标清楚哪些是推文里的硬事实,哪些是我的推测和背景补充。这年头看 AI 新闻,最怕的就是把一条 CEO 推文当成已经发生的事实,我尽量不干这事。

先说那个 1.5T。

V9 基础模型,1.5T 参数,这里的 T 是 trillion,一万亿。基础模型(foundation model)就是那个还没针对具体任务调教过的「毛坯」大模型,后面所有的对话能力、写代码能力、拒绝有害请求的能力,都是在这个毛坯上接着训出来的。1.5T 这个数字,放在公开披露的模型里算是相当大的一档了。当然这里得提醒一句,参数量大不等于更聪明,这两年小而精的模型一个接一个打脸大模型,新浪前两天开源那个 3B 的 VibeThinker,数学和代码能力直接干到比它大两三百倍的模型那个水平。所以 1.5T 这个数我看到的第一反应不是「哇好强」,而是「xAI 这是把算力往死里堆」。

这就接上了那句最容易被忽略、但我觉得最有分量的话,今年每个月从头训一个新模型。

你品品这句话。从头训练(trained from scratch),不是在老模型上接着微调,是推倒重来。一个 1.5T 量级的模型从零训一遍,烧的卡、烧的电、烧的钱,是个天文数字。能放出「每个月一个」这种话,背后撑着的是 xAI 那个在孟菲斯的超算集群 Colossus,几十万张 GPU 的规模。我没法核实他们是不是真能做到月更,但敢这么说,至少说明他们手里的算力余量大到可以拿模型当快消品来迭代。这个节奏要是真跑起来,对整个行业是另一种维度的碾压,别人还在为一次训练攒钱攒卡的时候,你这边按月出货。

当然,能不能兑现是另一回事。马斯克给的 deadline,大家心里都有杆秤。我把这条记下来,年底再回来看看打几折。

接着说我个人最感兴趣的那个点,Cursor data added in supplemental training,补充训练里加了 Cursor 的数据。

Cursor(官网在这)是现在程序员里用得最凶的 AI 代码编辑器之一,你在里面写代码、让 AI 补全、跟 AI 来回改 bug,这些交互会产生海量的真实编程数据。把这种数据喂进模型的补充训练,逻辑上是说得通的,因为它是真人程序员在真实项目里跟 AI 协作的一手记录,比那种合成出来的代码数据要鲜活得多。模型学这种数据,理论上写代码、改 bug 的手感会更接近人类工程师的真实工作流。

但我看到这句话,脑子里冒出来的第一个问题是,这数据是怎么来的,授权边界在哪。我先声明这是我的疑问不是指控,xAI 和 Cursor 之间是什么合作关系、数据是公开采购还是另有安排,推文里一个字没提,我也查不到公开说法。我只是作为一个天天跟这些工具打交道的人,对「用一个产品里的用户交互数据去训另一家的模型」这个动作,会本能地多想一层。你写在 Cursor 里的代码,最后变成了别人模型权重里的一部分,这事儿听着就值得多问一句。这条我标记为开放问题,谁有确切信息欢迎告诉我。

然后是那个被引用最多的卖点,性能接近、或许超越 Opus。

Opus 是 Anthropic 的 Claude 家族里最顶那一档(Claude 在这),现在基本是行业公认的第一梯队标杆。所以任何一个新模型出来,对标的姿势永远是「我接近 Opus 了」「我某些项超过 Opus 了」。这话我这两年听了不下二十回。

我不是说 Grok 4.5 不行,xAI 这一年进步是真快,从 Grok 3 到现在这个迭代速度肉眼可见。我想提醒的是那个措辞,close to, perhaps exceeding,接近、或许超过。这个 perhaps 用得相当谨慎,等于自己先把话留了三分余地。再加一个前缀,early evals,初步评估。一个内部的、初步的、自己跑的评估,说自己或许超过了 Opus。这话翻译成大白话就是,我们自己测着感觉还行,具体行不行等公开了再说。

我不是阴阳,我是真心觉得,看模型这事儿,CEO 的推文只能当个预告片看,正片得等独立第三方在公开榜单上复测。LMArena 那种盲测、各家自己藏的私有评测集、还有最硬核的,把模型真扔进生产环境里看它怎么翻车,这些才算数。在那之前,「接近 Opus」就是一句预告片台词,听个响,记在小本本上,别当真。

这里插一句我自己的活儿。马斯克那条推文里还有半句,the Grok Build harness gets better every day,Grok Build 的 harness 每天都在变好。harness 这个词,可能不少朋友不认识,我用人话解释一下,它指的是让大模型真正能干活的那层工程脚手架,模型本身只会输出文字,但你要让它去调工具、查资料、跑代码、自己重试失败的步骤,中间得有一整套调度和工具链托着它,这层东西就叫 harness。

我平时干的就是这个。说实话,模型能力本身固然重要,但同一个模型,配一套好的脚手架和配一套烂的,干活效果能差出一个数量级。马斯克专门把 harness 拎出来说,说明他们也越来越意识到,光有一个强模型不够,外面那层工程才是把模型能力榨出来的关键。这点我举双手赞同,因为这就是我每天上班在跟的东西,模型再聪明,超时没设好、重试逻辑写挫了、上下文塞爆了,照样给你表演原地去世。

脚手架托着一个发光的模型内核,挂着重试、超时、仪表盘这些工程零件

再说回那个 dogfooding。

私测放在 SpaceX 和 Tesla 内部,这步棋我觉得挺聪明的。dogfooding(自己吃自己的狗粮)是说先让自家团队用自家产品。但 SpaceX 和 Tesla 这俩地方,不是普通的内部测试场,是真有硬核工程负载的地方,火箭的代码、汽车的代码、生产线的数据。把一个还没公开的模型先扔进这种环境压一压,比找一千个外部用户随便聊聊天,能暴露出来的问题深得多。这是马斯克手里一张别家没有的牌,他自己就握着两家高强度的工程公司,天然的极限测试场。

好家伙,写到这我突然意识到,这条推文真正厉害的地方,可能根本不是 Grok 4.5 这个模型本身,而是它背后那套已经转起来的飞轮。自家的超算集群提供算力,自家的两家公司提供真实负载和测试场,月更的迭代节奏摊薄单次试错的心理成本,再加上一个越练越顺的 harness 把模型能力兜住。模型只是这台机器吐出来的产品,机器本身才是护城河。

算力、火箭与汽车的真实负载、月更节奏、脚手架兜住内核,四个环节首尾相接转成一个飞轮

当然了,这套叙事是马斯克最擅长的,把愿景讲得让你热血上头。我作为一个看了太多 PPT 起飞、demo 翻车的人,已经学会了一边听一边在心里默默打折。但这次我承认,那个飞轮的逻辑,物理上是成立的,不是纯画饼。能不能跑成另说,至少方向是真的。

那作为一个普通的、用 AI 写代码养家糊口的程序员,这事儿跟我有啥关系?

短期看没啥关系,私测嘛,咱也摸不着。但中期有个信号值得留意,如果 xAI 真把这套月更飞轮跑起来,那意味着前排选手的迭代节奏又往上提了一档。OpenAI、Anthropic、Google、xAI 几家你追我赶,最后受益的是我们这些用模型干活的人,工具越来越强,价格被卷得越来越低。前两天还看到有美国企业因为账单太贵,把工作负载从贵的模型大批切到 DeepSeek 上,省下来的是真金白银。竞争越凶,我们手里的牌越多。

我有时候觉得,我们这代程序员赶上了一个挺荒诞又挺幸运的时候。一边是焦虑,工具迭代快得让你刚学会一个就过时;一边又是兴奋,每隔几天就有个新东西冒出来,让你忍不住想打开终端试一把。万能青年旅店那句歌词怎么唱来着,是谁来自山川湖海,却囿于昼夜厨房与爱。我们这些人大概是,明明被困在一个个 deadline 和报错里,却又总忍不住抬头看看远处那片越来越快的浪潮。

所以这条推文我最后给它的定位是,一份信息量很大的预告片,外加一个值得长期盯着看的飞轮。Grok 4.5 到底行不行,等它公开了、等第三方复测了再说。但马斯克手里那套算力加负载加节奏的组合拳,是真的开始打出来了。

我会接着盯着。等 Grok 4.5 正式开放、有公开榜单数据了,我再回来跟你掰扯掰扯,它到底是不是真接近了 Opus,还是又一句听个响的预告。

(参考链接,马斯克原推 x.com/elonmusk,xAI 官网 x.ai,Grok grok.com,Cursor cursor.com,Anthropic Claude anthropic.com/claude,SpaceX spacex.com