模型降价 300 倍,Salesforce 还是烧掉了 3 亿美元
模型一年比一年便宜,账单一年比一年吓人。
先看几个数字。LLM 的 token 单价从 2023 年到现在累计降了大约 300 倍,同一段话让模型读一遍,现在的价钱是三年前的三百分之一。照理说企业的 AI 支出应该越来越轻松才对。
实际发生的是,Uber 四个月用完了整年的 AI 预算。Salesforce 花了 3 亿美元买 token,同时冻结了工程师招聘。微软干脆取消了好几个部门的 Claude Code 许可证。
单价打一折再打一折,账单反而爆了。这事就发生在此刻的各家财务报表上。
然后是今天的新闻。OpenAI 发了篇文章,给企业管理者提了个新记分卡,原话翻译过来是,token 单价本身说明不了 AI 有没有创造价值,你该看的是每美元有用功,完成了多少任务、省了多少时间、改善了多少决策、有多少工作流真正能规模化。
好家伙,卖 token 的劝你别盯着 token 价格看。这话从 OpenAI 嘴里说出来,多少有点卖电的劝你别看电价的意思。但抛开立场,这次它说的是对的,而且是我今年看到的最值得工程师抄走的一个视角。
先把那个悖论拆开,单价降 300 倍,账单凭什么还能涨。
因为消耗结构变了。三年前你用 AI 是聊天,一问一答,token 消耗跟对话长度成正比。现在你用 AI 是跑 agent,就是让模型自主拆任务、调工具、循环干活的那种用法。而 agent 的消耗结构完全是另一回事,系统提示、工具定义、对话历史,每一轮都要原样重放一遍。任务失败了要重试,重试也是钱。复杂任务开多个 agent 并行,每个都在烧。我天天盯着 token 账单看,一个 agent 任务跑下来,真正的新内容可能只占消耗的一成,剩下九成全是重放和重试。
单价是油价,账单是油价乘以油耗乘以里程。油价降了 300 倍,但你从骑自行车换成了开重卡车队,还经常绕路。
这也是为什么,整个行业正在悄悄换记分牌。
微软已经在模型发布卡上加了一个新指标,平均 token 使用量。评估从此分两层,性能多强,以及达到这个性能烧了多少。它自家的 MAI-Code-1-Flash 打的卖点就是在 SWE-Bench Verified 上比 Claude Haiku 4.5 少用 60% 的 token。还有个更扎心的对比,GPT-5.5 和 Claude Opus 4.8 的智能指数几乎打平,都在 60 分上下,但跑完同一套测试集,一个花 3357 美元,一个花 4685 美元,差了 40%。

分数一样,账单差四成。这种对比一旦摆上台面,竞争的性质就变了。

今天上午我刚写过 Kimi K3,它发布时把「缓存命中输入 2 元、编程场景命中率超 90%」放在定价页最显眼的位置。当时我说那张价格表是照着 agent 时代的消耗结构设计的,现在看,这不是 K3 一家的小聪明,是所有模型厂都挤在同一条赛道上了。跑分战争打了三年,接下来是账本战争。
铺垫完了,说点你今天就能用的。如果你在团队里管 AI 工具的预算,或者只是想搞清楚自己的订阅费花得值不值,这套算账法可以直接抄。
核心就一条,别按 token 记账,按结果记账。token 是成本的计量单位,不是价值的计量单位。你该记的是,合并一个 PR 花了多少钱,关闭一张工单花了多少钱,产出一份能直接用的文档花了多少钱。分母是钱,分子是干成的事。
具体做起来分三步。给每类 agent 任务记两个数,成功率和单次成本,失败的重试消耗要算进成本里,别只算成功那次。然后按「每个成功结果的全成本」排序,你大概率会发现,最烧钱的不是那个跑得最多的任务,是那个成功率最低、一直在重试的任务。砍自动化先砍它,比换便宜模型立竿见影。
最后盯一个杠杆,缓存命中率。agent 场景下它直接决定你输入成本的量级,命中率从 50% 提到 90%,比任何谈判砍价都管用。提升的办法也不玄,把系统提示和工具定义固定住别频繁改,把长上下文的复用结构设计好。
没在公司管预算、只是自己掏钱订阅的朋友,这套账一样适用,只是分母换成你每月那几十美元。你可以回想一下,上个月它帮你干成了几件事,是替你写完了真的合进去的代码,还是生成了一堆你看完就关掉的草稿。同样二十美元,有人换回来五十个合并的 PR,有人换回来一堆重新来过。工具没差别,用法的差别就是这么大。
我知道有人看到这会皱眉,用个 AI 还要算这么细,是不是太抠了。我非常理解这种感觉,创造性工作最烦的就是被逼着量化。但这套账的目的不是让你少用,恰恰相反,是让你敢多用。算清楚哪类任务成功率高、单位成本低,你才敢放心把它铺到整个团队,而不是在账单爆掉的那个月被一刀切砍掉所有许可证。微软那几个部门的 Claude Code,就是没人算账的代价,最后买单的是真在用它干活的工程师。
坦率讲,这套账很多团队从来没算过。大家对着仪表盘上的 token 消耗曲线发愁,却说不出上个月 AI 到底干成了多少件事。曲线只会告诉你烧了多少,不会告诉你值不值。
单价接下来还会继续降,这个趋势没有悬念。但看完 Uber 和 Salesforce 的账单你就明白,降价救不了不会算账的团队。会算每美元有用功的团队和只会看单价的团队,几年后拉开的差距,可能比用哪家模型的代差还大。
模型越便宜,算账越重要。这大概是 AI 行业今年最不性感、但最值钱的一个转折。