旗舰模型是面子,Flash 才是谷歌的印钞机

小岛AI 2026 / 07 / 23

220 亿。

这是 Gemini 现在每分钟处理的 API token 数。token 就是大模型吞吐文本的最小单位,一个英文单词大概一到两个 token,中文一两个字算一个。每分钟 220 亿,换算一下,相当于每一分钟把整个英文维基百科的量级过一遍。上个季度这个数还是 160 亿,三个月涨了近四成。

昨晚 Alphabet 发了 2026 年 Q2 财报,今天各家的标题都在写营收 1198 亿美元、同比涨 24%、Cloud 暴涨 82%。这些数字确实猛,但坦率讲,通稿里最有意思的信号根本不是这些。

是 Pichai 在 X 上补的那半句,220 亿 token 每分钟的增长,「由 Flash 模型驱动」。

不是 Pro,不是 Ultra,不是任何一个发布会上拿来刷榜的旗舰。是 Flash,谷歌模型家族里那个最便宜、最快、单价最低的型号。

Gemini 每分钟 API token 处理量,一个季度从 160 亿涨到 220 亿

我看到这句的时候心里咯噔了一下。因为它跟我最近观察到的另外两件事,刚好串成了一条线。这篇想跟你唠的就是这条线,钱到底是哪个模型赚的。

先把财报大数字快进掉,读者在别的号应该已经刷过一遍了。营收 1198 亿美元同比涨 24%,连续第 12 个季度双位数增长。Google Cloud 收入 247.7 亿,同比涨 82%,去年同期才 136 亿。整体经营利润 407.7 亿,利润率 34%。官方新闻稿在 Alphabet 投资者页面,原始 PDF 在这里,数字都能对上。

顺手拆一个大部分通稿懒得拆的坑。你可能刷到过「谷歌净利润暴涨 298%」这种标题,1121 亿美元的季度净利润,EPS 涨了 294%。听着像业务起飞了三倍对吧。

翻到财报第二页你会发现,other income 那一栏躺着 980 亿美元的净收益,主要是股权投资的未实现收益。人话就是,谷歌手里持有的其它公司股份涨价了,按会计准则计入利润,但一分钱现金都没进账。把这笔纸面浮盈刨掉,经营层面的利润涨幅是 30%。30% 依然很棒,但跟 298% 是两个故事。以后再看到三位数的净利润涨幅,先翻翻 other income,这个习惯能帮你过滤掉一半的标题。

好,通稿部分到此为止。回到那条线。

第一件事,上周二 Google DeepMind 发了三个新模型,Gemini 3.6 Flash、3.5 Flash-Lite、3.5 Flash Cyber。你发现没有,三个全是 Flash 系。没有 Pro,没有 Ultra,旗舰线一个都没动。当时不少人还在等 Pro 的消息,结果等来的是官宣 Gemini 4 开始预训练,旗舰要再憋一阵。

放在以前,这种「只发小模型」的更新会被解读成挤牙膏。但昨晚的财报电话会给了另一种解释。Pichai 在新闻稿里点名夸的模型只有一个,Gemini 3.5 Flash Cyber,原话是前沿水平的高性价比。财报新闻稿的措辞是按律师和 IR 团队逐字抠过的,CEO 在里面夸哪个产品,跟发布会上夸哪个产品,含金量完全不一样。前者是讲给华尔街听的,意思是这个东西在赚钱。

第二件事,同一天 Cursor 发布了 Cursor Router,一个自动模型路由系统。路由的意思是,你提交一个编码请求,系统自己判断该派给哪个模型,简单任务派便宜的,难任务派贵的。他们放出了在线 A/B 测试数据,Auto Balance 模式的用户满意度超过了 Opus 4.8,成本降了 36%。另一档 Auto Intelligence,满意度接近 Fable,成本降了 60%。

你品品这个数据。用户以为自己需要最强的模型,实际上把六成请求悄悄换成便宜模型之后,满意度不降反升。

这两件事加上财报里那句「由 Flash 驱动」,拼出来的图景就一句话,整个行业的流量重心正在从旗舰模型滑向便宜模型,而且这个滑动是赚钱的。

怎么说呢,这事其实不玄学,拆开看全是朴素的算术。

我平时的工作是给大模型搭脚手架,就是 agent 的工具链、调度、评测这些让模型真正能干活的工程层。在这个位置上看模型调用账单,有个体感特别强烈,一个正经的 AI 应用里,真正需要旗舰模型智商的请求占比小得可怜。分类、抽取、改写、格式化、总结、路由判断,这些占了流水线八成以上的调用量,全是 Flash 级模型闭着眼就能干对的活。剩下不到两成,复杂推理、疑难代码、长链路规划,才轮到旗舰出场。

流量分布是金字塔,塔基大得惊人。而塔基的每一次调用,都跑在单价最低、吞吐最高、利用率最好的模型上。

利用率这个词展开一下。数据中心里的 TPU 和 GPU 是按时间烧钱的,芯片空转一秒就是纯亏一秒。大模型推理想省钱,核心就是把一堆请求打包在一起算,机器塞得越满,单条请求的成本越低。小模型体积小,同一块芯片上能塞进去的并发请求多好几倍,天生就是拿来跑量的体质。旗舰模型单次调用贵,但量少、批次难凑满,摊薄成本反而难看。

所以财报里那个最扎眼的对比就有了着落。Google Cloud 的经营利润率,去年同期 20.7%,这个季度 35.6%,利润额从 28 亿干到 88 亿。一年时间利润率抬了 15 个点,靠的不是把模型卖得更贵,而是把便宜模型的量跑起来了。

Google Cloud 收入涨 82%,经营利润翻了三倍还多

好家伙,印钞机根本不在聚光灯底下。发布会上刷榜的旗舰是招牌,挂在门口吸引你进店。真正在后厨里日夜不停出餐的,是 Flash。

门口的招牌负责好看,后厨的小锅负责出餐

这里我得公平地补一句对面的视角。旗舰模型当然不是没用的花瓶,没有 Gemini 旗舰撑住品牌和能力上限,客户凭什么信你家的 Flash。旗舰是研发出来的能力天花板,Flash 是把天花板蒸馏之后大规模变现的形态。蒸馏就是拿大模型当老师教小模型,把能力压进一个便宜得多的身体里。这套打法转起来就是,旗舰负责突破,小模型负责收钱。我说 Flash 是印钞机,不是说旗舰没价值,是说现金流的重心在哪一边,财报已经写得明明白白。

那谷歌收上来的钱花哪了。这就是昨晚股价的黑色幽默部分。

财报超预期,盘后股价反而跌了。原因是资本开支,Q2 一个季度 449 亿美元,同比翻倍。全年指引再次上调到 1800 到 1900 亿美元,四月份给的指引还是 1750 到 1850 亿。CNBC 的报道里,CFO 说 2027 年还要在这个基础上显著增加。

1900 亿美元是什么概念,比绝大多数国家一年的军费都高,全砸在数据中心、芯片和电力上。自由现金流利润率从 21% 掉到 9.2%,就是说赚回来的钱大头又立刻埋回地里了。

更有意思的是财报附注里的融资动作。六月增发股票加可转换优先股,净募资 496 亿美元。另外备了一个最高 400 亿的市价增发计划。二季度还发了 203 亿美元的债。

你想想看这个画面,一家单季经营利润 400 亿的公司,同时在增发、发优先股、发债,三管齐下借钱。一边是史上最能印钞的商业模式,一边是史上最烧钱的军备竞赛,两边同时踩到底。Gemini 4 那个号称史上最大的预训练已经开跑了,这些钱就是它的燃料。

厉害了,赚钱的速度居然追不上花钱的速度,这种事也就这个行业干得出来。

好,宏观的部分聊完了,落回到咱们写代码的人身上。这份财报里我觉得有三个可以直接拿走的判断。

第一个,选型别迷信旗舰,先用 Flash 级把流水线跑通。这是我自己的真实工作习惯,新需求上来,默认全线用便宜模型先把链路搭起来,跑通了再看评测结果,只在质量真的卡住的那几个环节换旗舰。绝大多数时候你会发现,需要换的环节比想象中少得多。Cursor 那组 A/B 数据不是孤例,它只是把整个行业都在偷偷做的事放到了台面上。反过来做的成本很高,一上来全用旗舰,账单先爆,然后你根本分不清哪些环节是真需要智商,哪些只是在浪费。

第二个,便宜模型会继续变便宜,而且变强。谷歌用真金白银投票了,1900 亿的资本开支,财报点名的却是 Flash 系。9.5 亿月活的 Gemini App、220 亿每分钟的 API 流量,全靠低成本推理撑着,这条曲线逼着所有厂商把小模型的性价比往死里卷。对开发者是实打实的红利,今天你觉得贵到用不起的能力,大概率半年后就出现在某家的 Flash 级模型里。做预算和排期的时候,可以把这个趋势当成一个可以依赖的常量。

第三个,你订阅的「最强模型」,体验正在被路由稀释,这未必是坏事,但你得知道。Cursor Router 只是开始,平台方在成本压力下全会走向这条路,你点的是旗舰套餐,底下跑的是一支模型舰队。满意度数据说明大部分场景你根本感知不到差别。真正的问题是剩下的小部分场景,你感知到了,却不知道是模型不行还是路由把你分给了小模型。以后排查「AI 怎么突然变笨了」的时候,记得把路由这个变量也放进怀疑名单。

说实话我也不确定这波资本开支竞赛最后会不会有人翻车,1900 亿一年的投入强度,历史上没有先例可以参考。但流量往便宜模型集中这件事,我觉得是看得比较真切的,因为它不靠信仰驱动,靠的是每一次 API 调用的成本核算,这种由无数笔小账加总出来的趋势,比任何发布会的承诺都硬。

写公众号的人喜欢盯着旗舰模型的跑分吵架,谁第一谁第二,热闹得很。但财报是个诚实的东西,它不关心谁更聪明,只关心谁在出货。

这个季度的答案是,每分钟 220 亿个 token,从那个最不起眼的型号里流出来,安静地,把钱赚了。

灯塔负责被看见,压舱石负责让船不翻。航线能走多远,从来是舱底那块石头说了算。