AI 账单比工资还高之后,他把流量 100% 切给了 DeepSeek
一家旧金山的小公司,二十五个人,CEO 跑出来跟 CNBC 哭穷,说每个月的 AI 账单比全公司发工资还多。
后来他干了件挺狠的事,把百分之百的流量从 Claude 切到了 DeepSeek,然后说这一刀下去,未来几个月能省下数百万美元。
这家公司叫 Lindy,做的是 AI agent 自动化那一摊。CEO 弗洛·克里维洛(Flo Crivello)原话我看完笑了一下,他说「别小看 AI 账单,这关乎企业的生死存亡,你现在来瞧瞧我们的成本曲线,简直是断崖式下跌」。
断崖式下跌这个词,放在融资 PR 里通常是用户增长,放在这儿是成本。挺魔幻的。

CNBC 这篇报道(IT 之家做了中文转述,链接放文末)其实戳的是一个我天天在工位上盯着的东西,token 预算。我的工作有一块就是给大模型搭那层让它真正能干活的工程脚手架,agent 的工具链、调度、上下文管理这些。听起来很高大上,但日常很大一部分时间,是在跟一根曲线较劲,就是 token 花销那根线。它涨起来的时候是真不讲道理。
所以这条新闻我读着特别有体感。今天想跟你唠唠,为什么 AI 账单会失控成这样,企业现在都在用什么招止血,以及 DeepSeek 这波到底便宜在哪。
先说账单是怎么失控的。
很多人对 AI 成本的直觉还停在 ChatGPT 会员二十美元一个月。但企业用的不是会员,是 API,按 token 计费。token 你可以粗暴理解成模型眼里的字,一个英文单词大概一到两个 token,一段中文差不多一个字一个 token 多一点。你每问一句、模型每答一句,进出的字数都在计价器上跳。
单看一次调用,便宜得几乎感觉不到。问题出在 agent 上。
agent 跟你手动聊天不一样。你让它去完成一个任务,比如「把这个仓库的测试跑一遍,挂了的修掉」,它背地里要自己跟模型对话几十上百轮。每一轮,它都得把之前发生的事重新塞回去给模型看一遍,因为大模型没有记忆,它不记得五分钟前你们聊过啥,每次都得把整段上下文重新喂。
这就是要命的地方。对话越长,每一轮要重发的历史越长,token 像滚雪球一样越滚越大。一个跑了二十轮的 agent 任务,最后几轮单次消耗可能是第一轮的几十倍。你以为你只是让它修个 bug,账单上记的是它来来回回读了几十遍整个项目。
CNBC 那篇里有个细节我觉得特别真实,他们说 AI 支出最先失控的,恰恰是辅助编程。开发者最爱试新工具,Cursor、Claude Code、Codex 轮着用,一个比一个能把上下文窗口塞满。写代码的场景天然就是长上下文加多轮调用,简直是 token 燃烧机的完美配方。厉害了,最懂技术的那拨人,最先把账单干爆。
那到底有多贵。我们来看真实的牌价。
Anthropic 官网的定价页写得清清楚楚,最强的 Claude Opus 那一档,输入是每百万 token 十五美元,输出每百万 token 七十五美元。注意输出比输入贵五倍,因为生成比阅读耗算力。
再看 DeepSeek 官方的定价,它家主力模型输入每百万 token 几毛钱的量级,输出也就一两美元上下,还分了缓存命中的更低价。
你把这两个数摆一块儿看。同样跑完一个任务,输出这块的单价能差出几十倍。一个月烧十万美元的 agent 负载,理论上换过去可能就剩几千。Lindy 那个 CEO 说省数百万,不是夸张,是算术。
当然,便宜不等于免费的午餐。我得说句公道话,Claude Opus 在复杂推理、长链路 agent 任务上的稳定性,到今天仍然是第一梯队,这也是为什么大家明知道贵还一直在用。DeepSeek 这一年追得猛,尤其在代码和数学上口碑很好,但你要说每个场景都能无损平替,那是营销话术,不是工程现实。

有意思的是,连这位把流量全切走的 CEO 都补了一句,他仍然是 Anthropic 的忠实粉丝,看好他们的下一代模型和上游整合,只是觉得中国模型会长期对 API 价格施加压力。你看,这不是非黑即白的站队,是一笔笔算出来的账。
这就引出了企业现在真正在做的事,model routing,模型路由。
这个词翻译过来有点玄,其实道理朴素得很。以前大家图省事,不管什么任务都甩给最贵最强的那个模型,反正它什么都能干。就好比你家里只有一辆顶配越野车,买菜也开它,接孩子也开它,油耗自然下不来。
模型路由就是给任务分级。简单的活,比如把一段话改个措辞、给邮件分个类、判断用户情绪是好是坏,这种交给便宜的小模型,秒回,几乎不要钱。中等复杂度的,给中档模型。只有真正需要硬核推理的那一小撮任务,才请最贵的旗舰出马。
我自己搭脚手架的时候,这块就是核心活儿之一。一个 agent 流程里往往有十几个调用点,你得一个个去判断,这一步到底需不需要最聪明的脑子。绝大多数节点其实不需要。一个用来判断「这个网页加载完了没」的调用,你给它上 Claude Opus,纯属杀鸡用牛刀,还是镶钻的那把牛刀。
把这些节点重新分配一遍,账单往往能砍掉一大半,效果还几乎不掉。这事儿没有任何魔法,就是一个个抠。
工具层面也成熟了。开源的 LiteLLM 就是干这个的,它给几百个模型套了一个统一的接口,你的代码只管发请求,背后切哪家模型、怎么按规则路由、超了预算怎么降级,它来管。还有 OpenRouter 这类聚合层,一个 key 调遍全市场,哪家便宜走哪家,甚至能按延迟和价格自动选路。这些东西半年前还算前沿玩法,现在已经是省钱的基础设施了。
除了换模型和分级,还有一招特别实用,缓存。
前面说过 agent 每一轮都要把历史重新喂一遍,这部分内容其实大段大段是重复的,系统提示词、工具说明、前几轮的对话,每轮几乎一字不变。既然不变,为什么每次都按全价重新算钱。
prompt caching 就是干这个的。它把那段反复出现的前缀在服务端存住,下次命中直接走缓存价,便宜一大截。Anthropic 在它的文档里专门讲了这个(prompt caching 官方文档),命中缓存的部分价格只剩十分之一。DeepSeek 更直接,它的上下文缓存是自动的,命中了输入价能掉到原来的几分之一,官方定价页里那个低价档说的就是这个。
我给你算笔糙账感受一下。假设一个 agent 任务跑二十轮,每轮要带上两万 token 的固定上下文。不开缓存,这两万 token 你得按全价付二十遍,等于四十万 token。开了缓存,第一遍全价,后面十九遍只按缓存价的零头算。光这一项,输入成本可能就砍到三分之一以下。再叠加前面的模型路由,省下来的就不是个零头了。
这些招数没一个是黑科技,全是工程上的精打细算。但 AI 这摊事现在最缺的恰恰就是这种精打细算。
说真的,我挺喜欢看这种变化。
去年这个时候,整个行业的氛围还是堆参数、拼榜单、比谁的上下文窗口长。那种 AI 重塑一切、数据飞轮转起来的发布会话术,听得人耳朵起茧。我以前也信过一点,后来天天在生产环境里看它翻车、看账单飙红,慢慢就清醒了。
现在风向变了。CNBC 那篇里还提了一句,克里维洛的老东家 Uber 也在勒紧裤腰带,给一些 AI 工具设了分级支出上限,基础档每月一千五百美元封顶。咨询公司 Highspring 的人则说,有些客户干脆先暂停投入,等能证明真金白银的回报率再说。
从「赶紧上 AI 别掉队」到「先算清楚这笔账划不划算」,这个转变我觉得是健康的。一个技术只有开始被认真地算成本、抠效率,才说明它真的进了生产,进了那些需要对每一分钱负责的角落,而不是停在 demo 和融资故事里。
而 DeepSeek 这波被疯抢,背后其实是一个更朴素的道理。当一个能力到了够用的水平,价格就会变成决定性因素。这在任何行业都成立,云计算这么走过来的,数据库这么走过来的,现在轮到大模型了。前沿模型负责把天花板顶高,性价比模型负责把地板铺平,让用得起的人多起来。两件事都重要,但后者才是让技术真正长进经济体里的那一步。
聊到这儿我想起万能青年旅店那句,是谁来自山川湖海,却囿于昼夜厨房与爱。模型也一样,参数可以来自星辰大海,落到企业手里,最后还是要囿于那张月底的账单。
所以如果你也在公司里捣鼓 AI,或者手里正管着一摊 agent 的开销,我的建议特别具体,今天就能做。
第一,把你最大的那个 AI 调用拉出来,看看它到底在用哪个模型,是不是哪儿都在用最贵的。
第二,挑出那些明显不需要顶配的节点,分类、改写、判断这种,换成便宜模型试一周,看效果掉不掉。多数情况下你会发现没人能看出区别。
第三,如果你还没接路由层,去翻翻 LiteLLM 的文档,搭起来比你想的快。
省下来的不只是钱,是你下个月不用再跟老板解释,为什么这条成本曲线又是断崖式上涨了。
往另一个方向断崖,总归是好事。