75% 代码 AI 写的 Google,旗舰却卡在编码上
今天是 7 月 17 号,这个日子在 AI 圈的日历上是被画了圈的。第三方爆料言之凿凿,说 Gemini 3.5 Pro 就在今天正式开放。我早上把 Google 的官方博客、DeepMind 的模型页、Gemini API 的文档挨个翻了一遍。
没有。连个模型卡的影子都没有。
等来的是另一条新闻。9to5Google 转述 Bloomberg 的报道,Google 正在花时间改进 Gemini 3.5 Pro 的能力,原话是「particularly in coding」,尤其是编码。更扎心的是下一句,6 月下旬 Google 更新了训练 Gemini 的数据,想把编码能力拉上来,结果就四个字,令人失望。
好家伙。全世界最不缺代码的公司,自家旗舰卡在了写代码上。
先把时间线捋一下,不长。5 月 19 号 I/O 大会,Google 发布 Gemini 3.5 Flash,台上顺口承诺 Pro 版下个月就到,还说内部已经在用了,「showing great improvements」。6 月过完,没动静。7 月中旬爆料满天飞,说 17 号 GA。今天,还是没动静,官方只给了一句非常公关的话,我们正在和合作伙伴测试 3.5 Pro、一个升级版 Flash 和其他模型,我们在快速交付大量模型的同时保持对客户的高性价比。
翻译一下,就是别催了。

从 I/O 的自信满满到现在的支支吾吾,中间发生了什么,Bloomberg 那篇报道给了答案,开发过程在 I/O 之后经历过一次重置,卡点就是编码。
怎么说呢,放在三年前,一个旗舰模型因为写代码不够好而推迟发布,这话听起来会很怪。那时候大家比的是常识问答,比的是写诗,比的是能不能算对三位数乘法。现在一个传闻里两百万 token 上下文的旗舰,多模态、长上下文、深度推理全都堆上去了,最后被绊住的,是编码。
这事我倒真不意外。
我的日常工作是给大模型搭脚手架,就是 agent 的工具链、评测、调度这些让模型真正干活的工程层,天天看模型在生产环境里怎么跑、怎么翻车。站在这个位置看,编码早就不是模型众多能力里普通的一项了,它是唯一一个每天被几百万开发者拿真实任务反复锤的能力。你写诗写得一般,读者顶多觉得没味道。你代码写得一般,CI 直接红给你看,用户当场退订。
编码的反馈是所有能力里最硬的。跑分可以挑角度,demo 可以剪辑,但一个开发者拿它改自己仓库里的 bug,十分钟就知道行不行,装不了一点。这也是为什么这一年模型厂商的发布会全在秀终端和编码基准,而不是秀作文。Google 自己在 I/O 上给 3.5 Flash 挂的招牌数字,Terminal-Bench 2.1 跑 76.2%,MCP Atlas 83.6%,清一色是编码和 agentic(让模型自己规划、调工具、干完整任务)的榜。
钱也全在这。企业订阅、API 消耗、编程工具的座席费,真金白银的大头全压在编码场景上。这一块要是不如对手,别的能力再漂亮也补不回票房。
所以 Google 宁可让旗舰一鸽再鸽,也不敢把一个编码不达标的 Pro 放出来。这个决定本身,比任何发布会都更能说明现在前沿竞争的重心挪到了哪里。
然后是我觉得整件事最有意思的部分。
同一篇报道里还有一个数字。截至今年 4 月,Google 内部 75% 的新代码是 AI 生成、由工程师审核通过的,去年秋天这个数字还是 50%。

你品一下这个画面。一家公司四分之三的新代码由 AI 写,而这家公司的旗舰模型,因为 AI 写代码写得不够好,跳票了。
这不是段子,这是同一篇新闻里挨着的两段。
再往下读还有更多。据前员工的说法,内部有一批立场很纯粹的工程师,认为重要代码就该人手写,才配得上 Google 的代码标准。想用 AI 工具的工程师呢,又面临内部算力配额的限制,想多用都排不上。对外的 AI 编程产品更是三摊子各自为战,DeepMind 管 AI Studio,Cloud 管 Vertex,Android 团队守着 Android Studio,最近才开始推动把这些整合起来。
也就是说,围绕用 AI 写代码这一件事,Google 内部同时存在着,用得最狠的实践、抵制得最认真的工程师、批不下来的算力,和三套互相不服的工具链。
一艘船,四个舵。
对照组前天深夜刚出现。Moonshot 放出 Kimi K3,2.8 万亿参数的开源 MoE(mixture of experts,把模型拆成一群专家网络,每次只点亮一小撮,参数堆得大,算起来却不贵),896 个专家每次激活 16 个,上下文一百万 token。昨天它顶到了前端编码榜的第一,开放权重,把两家闭源旗舰压在身后。开源模型在编码榜上登顶,这在一年前还是键盘侠的段子,现在是榜单截图。
一边是闭源旗舰因为编码不达标一鸽再鸽,一边是开放权重在编码榜上登顶。这两条新闻挤在同一周里,比任何行业分析都直白。以前的叙事是开源永远差半代,闭源旗舰负责定义天花板。现在天花板自己难产了,追的人可一天没歇。窗口期这个东西很残酷,你跳票的每一天,都是对手白捡的一天。
这里我得对冲一句,免得写成爽文。Gemini 3.5 Flash 本身不弱,编码和 agentic 榜面超过了自家上一代旗舰 3.1 Pro,输出速度还快。Google 手里的牌其实不差,TPU、数据、分发渠道都在,搜索框和安卓就是别人拿不到的入场券。跳票说明的不是 Google 不行,是编码这个能力比所有人想象的都难堆。
难在哪,我自己的理解是两层。第一层,代码的对错是零一裁判,编译器和测试不接受差不多,别的能力可以靠语言的模糊性蒙混,代码蒙混不了。第二层更麻烦,公开代码库里大部分代码本身就写得不怎么样,数据不是越多越好,把烂代码喂进去,模型学到的是烂品味。Google 换了训练数据还是失望,恰恰暗示问题不在数据的量,在怎么让模型对「什么是好代码」长出品味。这玩意目前看没有捷径,谁先摸到谁吃肉。
顺带提醒一句,这几天满天飞的那些规格,两百万 token 上下文、Deep Think 深度推理锁在每月 250 美元的 Ultra 订阅里、API 定价输入 1.25 美元输出 10 美元每百万 token,全部来自匿名爆料,没有一个字是官方确认的。公开的 API 文档里到现在都没有 gemini-3.5-pro 这个条目。别拿传闻做技术选型,也别拿传闻立项写方案,被打脸的时候,爆料博主可不会替你写复盘。
那屏幕前写代码的你,该怎么消化这条新闻。我自己的感受是三条,都不复杂,也可能不成熟,你挑着看。
第一条,别等了。「等 Gemini 3.5 Pro 出来再说」这个句式,我在好几个技术群里都见过。现在官方连新日期都不肯给,你等的东西可能下周来,可能九月来,来了还不一定比你手头在用的强。选型看今天货架上摆着的东西,Fable、GPT、Kimi、DeepSeek,谁在你自己的任务上表现好就用谁,而不是看谁的路线图画得远。
第二条,把评测握在自己手里。榜单是厂商的主场,你的代码库才是你的主场。攒十几个自己真实业务里的任务,修一个线上 bug、加一个带鉴权的接口、重构一段谁都不敢动的老逻辑,新模型出来就跑一遍,半小时出答案,比刷十篇测评都管用。旗舰跳票这种新闻对你的影响本该无限接近于零,因为你的判断不依赖任何人的档期。
第三条,架构上别跟任何一家绑死。模型这层的洗牌速度已经快到,你今天押注的胜者,半年后可能就是跳票王。把模型当可替换的零件,提示词、工具层、评测集都往可迁移的方向搭,谁强换谁。换的成本越低,你就越自由,厂商的档期就越与你无关。
回到今天早上。7 月 17 号,日历上画的那个圈空了,但圈外的事一件都没停,开源模型在编码榜上又爬了一格,写代码这件事的定价权,正从发布会的舞台上,慢慢挪到每个开发者自己的终端里。
船不等风。到点就起航的人,从来不赌哪朵云先落雨。