Kimi K3 冲到第三,这周真正的新闻不是它
7 月 8 日到 7 月 16 日,八天,四款前沿模型。
Grok 4.5 打头阵,第二天 OpenAI 一口气放出 GPT-5.6 的仨版本,Meta 的 Muse Spark 1.1 同一天跟进,然后 7 月 16 日,Kimi K3 压轴登场。好家伙,这个密度放在一年前,够整个行业消化一个季度。
数据来自 Artificial Analysis,一家专门给大模型跑统一评测的第三方机构,你可以把它理解成大模型圈的跑分天梯,所有模型用同一套题、同一个口径,谁强谁弱一眼看清。他们 17 号发了条总结推文,把这八天摊开摆在桌上。我反复看了几遍,越看越觉得,中文圈的头条虽然都给了 Kimi K3,但 K3 只是这串鞭炮里最响的一个,真正的新闻藏在鞭炮后面。
先把 K3 的部分快进讲完,毕竟它确实争气。智能指数 57 分,总榜第三,压过 Claude Opus 4.8 的 56 分。在 GDPval-AA v2 这种模拟真实职业任务的评测里排第三,在考察长时程知识工作的 AA-Briefcase 上直接排到第二,分析质量的 Elo 分跟榜首的 Claude Fable 5 基本打平。定价 3 美元输入 15 美元输出,还承诺 7 月 27 日前开放权重,2.8 万亿参数,史上最大的开放权重模型。这些各家都写过了,通稿部分到此为止。
真正值得盯住的是三条曲线。
第一条,能摸到前沿的实验室,六周之内从 2 家变成了 6 家。
6 月之前,智能指数 51 分以上的模型只有两家能做,Anthropic 和 OpenAI,别人连门都摸不到。6 月中旬智谱的 GLM-5.2 把 Z AI 带进了这个俱乐部,上周 SpaceXAI 和 Meta 前后脚进场,这周 Kimi K3 让月之暗面成了第六家,而且人家不是踩着门槛进来的,是直接以 57 分坐到了第三排。
俱乐部扩员的速度有多夸张呢,智能指数前十的模型里,四款是 7 月 8 日以后发的,六款是 6 月以后发的。榜单前三来自三家不同的实验室,总分差只有 3 分。

第二条,第一名没换人,但护城河快没了。
Claude Fable 5 从 6 月 9 日霸榜到今天,60 分,这个位置一动没动。动的是它跟第二名的距离,从 4 分缩到了 1 分。一个多月前它还是独一档,现在身后 3 分之内挤了一排人。
第三条,也是我觉得最狠的一条,智能的价格八天便宜了两三倍。
Artificial Analysis 有个挺聪明的口径,叫每任务成本,不算每百万 token 多少钱,算跑完他们整套评测里一个任务平均花多少钱。这个数比单纯的 token 价格诚实得多,因为它把「这模型话多不多、要推理多久」全算进去了,更接近你月底看到的真实账单。OpenAI 前两天也在推类似的记分卡,思路都是一个方向,别看标价,看单位有用产出的成本。
按这个口径,GPT-5.6 Sol 比 Claude Fable 5 只低 1 分,每任务 1.04 美元对 2.75 美元。Grok 4.5 拿 54 分,每任务 0.31 美元,不到上一代同档位的三分之一。51 分这个档位更热闹,GPT-5.6 Luna 干到 0.21 美元,Muse Spark 1.1 是 0.26 美元,而一周之前,这个档位最便宜的 GLM-5.2 还要 0.32 美元。一周,档位地板价又被凿穿一层。

Kimi K3 的账也一样,0.94 美元一个任务,拿到跟 Claude Opus 4.8 相当的智能,价格是人家的一半,这一手定价有点子牛逼。
看到这你大概明白我说「真正的新闻不是 K3」是什么意思了。单看任何一款模型都是常规发布,摞在一起看,是前沿这个词本身在贬值,或者用 Artificial Analysis 自己的话说,frontier 打开了。以前前沿是两家实验室的后花园,现在是六家抢摊位的夜市,而且摊位费一周掉一半。
然后我想聊聊,这串数字落到咱们写代码的人头上,会变成什么。坦率讲,这才是我想写这篇的原因。
你想想看这八天普通开发者的体验。周三刷到 Grok 4.5 发布,寻思周末试试。周四醒来 GPT-5.6 仨版本加 Muse Spark 齐发,时间线全是评测截图。还没缓过来,隔了一周 Kimi K3 又把榜单洗了一遍。每一个都有人喊「快切、不切就落后了」。要是每次都当真,你这个月啥也别干了,光迁移模型了。
我的建议正好相反,发布越密,越不该追着切。
我的日常工作是给大模型搭脚手架的,agent 的工具链、评测、调度这些让模型真正干活的工程层,所以模型迁移这件事的真实成本,我可能比多数人体感更深。换一个主力模型,从来不是改一行模型名那么简单。提示词要回归测试,工具调用的格式差异要兼容,限流策略要重调,计费对账要重来,还有一堆你以为稳定了的边角 case 会重新冒出来。之前有团队迁移生产环境 agent 到 GPT-5.6,光是查清楚成本异常就折腾了好几轮,最后发现问题出在自己的配置上。切模型的隐性成本,行业里被严重低估。
所以在一个八天出四款模型的市场里,我自己的策略就四条,不一定对,你随便听听。
主力模型,只在有具体痛点的时候换。榜单上 1 分的差距,落到你的场景里很可能是 0 分,甚至是负分,因为你的提示词是围绕旧模型调的。「榜单第一换人了」不构成迁移理由,「我的场景里它反复搞砸某类任务,新模型实测能解决」才构成。
评测,自己攒一套小的。从你真实业务里挑二三十条任务,带标准答案那种,新模型出来先跑自己这套,十几分钟出结果,比刷任何评测截图都有用。通用榜单衡量的是模型的平均能力,你的业务从来不是平均场景。模型会过期,这套评测集不会,它是你在这波浪潮里少数真正属于自己的资产。
便宜档,拿来跑实验。0.2 到 0.3 美元一个任务的那几款,智能已经够到一年前的旗舰水平了,批量分类、摘要、数据清洗这类活完全可以扔过去。另外价格八天掉两三倍的市场里,别签任何长期锁量的合同,谁劝你锁一年的量,你就把这篇转给他看看。

开放权重的,等它兑现。K3 说 7 月 27 日前开权重,如果真放出来,私有化部署这条路上就多了一个前沿档的真选项。到时候值得单独写一篇。
对了,这场八天连发里还有个缺席的。Google 的 Gemini 3.5 Pro 原定 6 月发布,因为编码和长时程推理不达标,推迟了好几个月。发布潮看着热闹,不是谁都跟得起的,跟不起的巨头都选了憋着,你一个写业务代码的,更没必要被节奏绑架。
写到这想起个画面。以前看前沿模型像看灯塔,孤零零一两座,全行业盯着它导航。现在灯塔一座接一座亮起来,密得像进了港区,反而没法靠它们认路了。这种时候老水手的办法是低头看自己的罗盘。
那套二三十条任务的评测集,就是罗盘。八天四款模型的时代,它比任何榜单都值钱。