975B 完整权重白给,Murati 团队卖的根本不是模型

小岛AI 2026 / 07 / 16

北京时间昨天凌晨两点,Mira Murati 的 Thinking Machines 放出了他们从零训练的第一个模型,名字叫 Inkling。975B 总参数的 MoE 混合专家模型(每次推理只激活 41B,不用全员上班),最长 100 万 token 上下文,文本、图像、音频一起吃,完整权重直接挂在 Hugging Face 上,谁都能下。

公告里有一句非常扎眼的话,他们自己白纸黑字写的,Inkling 不是当前最强的模型,开源闭源都算上,也不是。

你见过哪家大厂这么发模型的。正常剧本是发布页恨不得每一屏都塞满全场最佳,跑分柱状图的纵轴恨不得从 80 分开始画,好把那两个百分点的领先拉成视觉上的断层。好家伙,这边第一屏就认怂。

但顺着公告往下读,我慢慢觉得这句认怂可能是全文最自信的一句话。因为人家压根没打算跟你比谁最强,他们在做另一门生意。

先把背景补齐,照顾一下没追这家公司的朋友。Thinking Machines 是 OpenAI 前 CTO Mira Murati 出走以后建的实验室,2025 年种子轮就融了 20 亿美金,产品还没影子,估值先到了 120 亿。之后整整一年多,这家公司发了个微调平台 Tinker,发了个叫 interaction models 的实时协作系统预览,再就是一篇接一篇的研究博客。圈里一度调侃,史上估值最高的博客主。

所以昨天这个发布,等于是他们第一次交底,让所有人看看这一年多的钱烧成了什么。

烧成的东西本身,账面上是这样。预训练吃了 45 万亿 token,文本图像音频视频混着来,在英伟达 GB300 NVL72 集群上训的。跑分嘛,AIME 2026 数学题 97.1%,SWE-bench Verified 修真实 GitHub issue 能到 77.6%,在开放权重阵营里排得进第一梯队,但确实够不着 Claude Fable 5 和 GPT 5.6 Sol 这些闭源旗舰的头部分数。旁边还预告了一个小号 Inkling-Small,激活参数只有 12B,好几项跑分反而追平甚至反超大哥,测完就放权重。

12B 激活的小号在多数基准上贴着 41B 的大哥跑,只有吃世界知识的 SimpleQA 掉了一半

如果只看到这里,这就是一条普通的开源发布新闻,各家资讯号今天都会推一遍的那种。有意思的地方在他们怎么解释自己为什么不冲最强。

公告的原话大意是,Inkling 被刻意训练成一个广而平衡的底座,不在任何单一榜单上死磕,因为它的使命不是被你直接用,而是被你拿去改。多模态、思考成本可调、能进 Tinker 微调,这三件事凑在一起才是卖点。

翻译成人话,这不是一个成品,这是一块毛坯,而他们真正想收钱的,是装修这个环节。

你看他们发布日干的事就明白了。Inkling 当天就能在 Tinker 上微调,限时五折。Tinker 控制台加了个 Playground 让你免费聊着玩,聊爽了好转化成微调客户。cookbook 更新了三个手把手教你调音频能力的示例。连发布演示都在暗示这件事,他们让 Inkling 自己在 Tinker 上写微调任务、自己跑、自己评估结果,模型给自己做了个微调。

这一手演示我是真觉得有点子牛逼,产品广告拍成了行为艺术。

卖铲子的故事大家都听腻了,我知道。但这次不太一样,铲子厂是自己先下矿挖了一年,炼出一块成色不错的矿石,然后告诉你矿石白送,冶炼炉按小时计费。模型权重是获客成本,微调平台才是营收。

矿石白送,冶炼炉按小时计费,这就是 Inkling 发布的全部商业逻辑

这个赌注押的是一个判断,通用模型再强,也解不好你手里那些浸透了行业知识的问题。他们之前发过一个金融领域的案例,拿专家判断数据微调过的中型模型,在特定任务上干翻通用旗舰。你想想看,法务合同审查、医疗影像报告、工厂质检日志,这些场景要的不是一个啥都懂一点的天才,是一个把你家规矩刻进权重里的老师傅。

行业现在明显分成了两条路线。一条是闭源旗舰的路子,模型越做越大,你按月交订阅费,能力涨价也涨,一切都是租的。另一条就是 Thinking Machines 押的这条,把够用的底座开放出来,让每家公司用自己的数据调出自己的模型,权重文件躺在你自己的对象存储里,谁也收不回去。

说真的,作为一个天天在工程层跟模型打交道的人(我的日常就是给大模型搭脚手架,工具链、评测、重试兜底这些让模型真正能干活的粗活),我对第二条路线是有私心的。因为这次发布里最戳我的几个细节,全都是冲着生产环境去的,不是冲着发布会去的。

第一个是思考努力度可调。Inkling 有个 effort 参数,从 0.2 拧到 0.99,模型思考的深度和吐出来的 token 量跟着变。官方给的数据,在 Terminal Bench 终端操作这个评测上,它用三分之一的 token 就追平了英伟达 Nemotron 3 Ultra 的分数。这事对刷榜没意义,跑分都是开满血跑的。但生产环境里,一个每天被调用几百万次的接口,token 就是电费,延迟就是用户流失。同一个模型,简单请求拧到 0.3,硬骨头拧到 0.9,这才是干活的人要的东西。

第二个是它被训练成不挑食。官方说训练时故意在一堆不同的 agent 框架里跑这个模型,工具集和接口格式都随机换着来,就是为了让它别对某一家的脚手架产生依赖。带过模型干活的人都懂这个痛,很多模型换个工具描述格式就性能跳水,跟只认一个牌子键盘的程序员似的。

第三个细节最好玩,藏在训练故事里。他们把强化学习跑到了三千万次 rollout(就是让模型反复做题拿反馈的那个过程),然后观察到一个没人设计过的现象,模型的思维链自己越变越短。训练早期它推理时还规规矩矩写完整句子,训练后期同一道题,冠词没了,连接词没了,We need to understand 直接缩成 We need determine,电报腔,但照样把题做对。没有任何奖励逼它这么干,纯粹是效率压力下自己涌现出来的。像不像一个老程序员,注释越写越短,变量名越起越糙,但代码一直能跑。

还有一个细节我必须单独拎出来说,怕你们漏掉。Inkling 后训练的冷启动,用的是开放权重模型生成的合成数据做初始微调,官方点名的模型里包括 Kimi K2.5。你敢信,硅谷估值百亿的明星实验室,第一个模型起跑时踩的梯子里有一截是月之暗面搭的。开源生态玩到今天,已经是你中有我我中有你,国产开源模型成了别人家旗舰的起跑器,这事放两年前谁敢想。

对了,他们还专门训练了模型说我不知道的能力。用的办法挺巧,设计一种只有大概率答对时作答才有收益的训练机制,答错倒扣,弃权不扣,最优策略自然收敛成有把握就答、没把握就老实承认。怎么说呢,我的日常工作里有相当一部分,就是在模型外面包各种校验和兜底逻辑,防着它一本正经地胡说八道。一个在权重层面就学会认怂的模型,能少写多少擦屁股代码,想想就觉得舒坦。

行文至此得泼点冷水,不然这篇就成通稿了。

975B 的总参数,就算只激活 41B,你家里那台游戏本也别惦记了,这玩意的推理门槛就是数据中心级别的。真正适合个人和小团队折腾的 Inkling-Small,权重还没放,官方说还在测试。限时五折的另一层含义是原价不便宜,微调 256K 长上下文这种活,账单不会跟你客气。而且它每一项跑分都够用但都不顶尖,如果你的场景就是要地表最强的通用智力,老老实实交闭源订阅费还是绕不开。

多模态那部分我也留个保留意见。音频视觉都是不带独立编码器的极简架构,图像切成小方块直接混进文本流里处理,跑分看着能打,但这种从零训的第一代多模态,真实场景里的边角案例多到什么程度,得等社区拿真实数据锤过才知道。

音频这块在开放权重阵营里确实能打,但跟闭源的 Gemini 3.1 Pro 还有肉眼可见的距离

第一批权重下下来的人,替我们探探雷。

但把冷水泼完,我的判断还是没变。这次发布真正的信号不是又多了一个开源模型,是又一家一线实验室把宝押在了定制这条路上,而且是用把家底全放出来的方式押的。生态那边的动作也跟上了,vLLM、SGLang、llama.cpp 这些主流推理框架的支持都是发布日就位,甚至给 Blackwell 显卡准备了压缩版的 NVFP4 checkpoint。这不是发一篇论文刷个存在感的姿态,是修港口、建灯塔、准备长期通航的姿态。

这大半年,我看着模型价格表来回变,看着各家的 API 条款一遍遍改。有一个感受越来越强烈,租来的能力再强,也是别人航线上的船票。Inkling 这步棋赌的就是,会有越来越多的人想要一条自己的船,哪怕小一点,哪怕得自己动手装修。

至于赌不赌得赢,我也说不好,市场最后可能证明大多数人就是更愿意买票。但至少昨天凌晨那份公告里,那句我们不是最强,读起来一点都不像认输。

像开航前的鸣笛。