GPT-5.6 正式发布,最狠的不是跑分
两周前还躺在审查传闻里的模型,今天正式发货了。
7 月 9 日,Sam Altman 发推说,这显然是我们有史以来最好的模型,也是我们写得最好的博文之一。点进去,GPT-5.6 全家正式全量开放,旗舰叫 Sol,日常主力叫 Terra,走性价比路线的叫 Luna。月初有论文泄出过这三个代号,当时圈里还在猜是不是内部实验分支,现在实锤了,就是三档定位。同一天 OpenAI 还上了另一个大件,ChatGPT Work,一个装在 ChatGPT 里的 agent,能在你的应用和文件之间自己动手,复杂项目自己拆成小步骤,必要时连着干上几个小时。
如果你六月底刷到过那条新闻,应该还记得 GPT-5.6 上一次出现在时间线上的姿势。当时的报道说它找安全漏洞的能力太强,被摁在有限预览里出不来,一度被传成了叫停。两周之后,它不仅放出来了,还把迄今最全面的安全评估写进了发布页第一屏,人类红队加大规模自动化测试,外部专家机构一轮轮压。这个反差先记着,文末我们回来算这笔账。
先说 ChatGPT Work 是个啥,用人话讲。
它是 ChatGPT 里新开的一个工作模式,你把 Slack、Teams、Google Drive、邮箱、日历、CRM 这些天天在用的东西通过插件连给它,然后交代一个目标,它自己去这些地方扒上下文,产出表格、幻灯片、文档,甚至直接给你搭个 Web 应用。提示词里打个 @ 加应用名,就能指定它去某个地方取料。中途你可以插话、改方向,重要操作它会停下来等你批准。人不在电脑前它也接着跑,定时任务可以让它每周自动把 Slack 里的新消息滚进会议议程,或者每天早上盯一圈网站和仪表盘,把变化总结成报告发你。还有个叫 Sites 的公测功能,能把干完的活直接变成一个可分享的网页应用,仪表盘、项目跟踪器、内部门户这类东西,一个 URL 甩给团队。

血统上它是 Codex 的孩子。OpenAI 给了个挺有信息量的数字,Codex 现在每周有超过 500 万人在用,其中 100 多万人干的压根不是软件开发。一个给程序员写代码的工具,硬是被非程序员用出了百万级规模,OpenAI 顺水推舟,把它泛化成了给所有打工人的 agent。发布页里 Zapier 的企业营销负责人现身说法,说拿它搭了套每月审阅几千条销售线索的系统,扒出了七位数的潜在销售额。OpenAI 自己内部更夸张,接近 100% 的团队在用,财务把月末结账从几天压到了几小时。
官方给的上手建议倒是实在,别一上来就交给它陌生领域的大活,先扔一个你自己闭着眼都能干的任务,月末预算差异分析、销售会议准备这种,看它跑出来的东西你能不能挑出毛病。这个建议我想给它加个注脚,你能验收的活才能放心外包,你自己都看不懂的活,agent 干得再欢你也只能烧香。可用性方面,网页和移动端今天先给 Pro、Enterprise 和 Edu 用户,Plus 和 Business 这几天陆续放开。

这个剧情是不是有点眼熟。两天前我们刚写过 Anthropic 那边的对应数据,Claude Cowork 的 120 万次会话里,软件开发只占 8.7%,最大头是业务流程和运营。两家公司在同一个月,用各自的数据说了同一句话,agent 的主战场已经不在写代码了。区别在于 Anthropic 发的是观察报告,OpenAI 直接把产品拍了出来,正面对撞 Cowork。
跑分部分我快进着讲,你在别的号肯定已经刷过一遍了。
Agents’ Last Exam,一个测 55 个专业领域长程工作流的基准,GPT-5.6 Sol 拿了 53.6,比 Claude Fable 5 高出 13.1 分。Artificial Analysis 的编程 agent 指数,Sol 满血推理拿到 80 分创了新高,用的输出 token 不到对手的一半,时间也不到一半。走量的 Luna 干过了 Opus 4.8。网页浏览基准 BrowseComp 干到 92.2%,电脑操作基准 OSWorld 2.0 拿了 62.6%,还顺手补了一刀,说比 Opus 4.8 少用 85% 的输出 token。设计能力也专门吹了一节,说 GPT-5.6 会用电脑操作能力亲自检查渲染出来的界面,不是只管生成代码,改完还自己看一眼效果再交活,这一手有点子牛逼。Cursor 的总裁也来站台,说是他们在 CursorBench 上测过最强的模型之一。

效率账更是从头算到尾。官方说 Sol 开中等推理档也能赢 Fable 5 十一分多,而估算成本只有四分之一。走量的 Terra 和 Luna 更狠,十六分之一的成本,跑分还压对手一头。
这些数字怎么看。坦率讲,全部出自 OpenAI 自家发布页,成本前面都挂着 estimated,对比模型开哪个档位也是他们挑的。每一场发布会都是发布方赢,行业惯例,看看就好,等第三方独立复测出来再下结论不迟。
但有一个信号我觉得是真的。整页博文翻下来,OpenAI 翻来覆去强调的不是我们更聪明,而是我们每个 token 干的活更多。高出多少分之外必带一句成本只有几分之一,赢的方式是便宜十六分之一地赢。上一轮发布季大家还在拼谁的天花板高,这一轮开始拼谁的电费单好看。军备竞赛进入了算账阶段,对掏钱的人来说,这算个好消息。
真正让我从椅子上坐直的是 ultra。
我的日常工作是给大模型搭脚手架,就是 agent 的工具链、调度、上下文管理这层,让模型真正能干活的工程。所以看到 ultra 的介绍时职业病直接犯了。它是 GPT-5.6 的最高档位,默认同时调度四个 agent 并行开工,官方图表里还秀了 16 个 agent 的配置,配合 Responses API 新开的多智能体 beta,开发者可以自己搭出同款。还有个叫 Programmatic Tool Calling 的新能力,模型自己写小段程序去协调工具、过滤中间结果,不用每次工具返回都绕回模型走一圈。
好家伙。任务拆分、并行调度、结果合并、中间数据过滤,这些以前要自己写编排器一点点抠的活,现在变成了模型的一个参数。去年这时候,多 agent 编排还被当成创业公司的护城河来讲,今年它成了发布页上的一个开关。护城河这个东西在 AI 行业的保质期,目测比酸奶长不了多少。
不过 ultra 的另一面,写在定价说明的小字里。
四个 agent 并行,就是四份 token 一起烧。OpenAI 的原话很委婉,使用量会随所需工作量变化,更复杂的任务可能消耗更多套餐内的使用量。翻译成人话,你让它连干四个小时,它就烧你四个小时的额度,还是并行着烧。发布页里专门给企业管理员做了支出控制、群组限额、超额申请审批流。一个功能要是不烧钱,厂商是不会贴心到提前给你搭好预算审批系统的。
还有一笔账 OpenAI 没帮你算,你的时间。
agent 连干几小时,产出一堆文档、表格、幻灯片,谁来验收,你来验收。我天天看 agent 在生产环境里跑,最深的体会是,生成的速度是模型的,验收的速度是人的。模型一小时吐十份报告,你还是得一份一份读,读不过来,就只能在信与不信之间二选一。OpenAI 在安全那节说,自动审阅层在红队测试里拦截了 100% 的敏感数据提取尝试。这个 100% 我个人习惯性打个问号,安全行业里所有的 100%,一般都活不过下一个星期天。
开发者还有两条要划重点。
第一条,Codex 独立应用没了,并入新的 ChatGPT 桌面应用,你现在用的老桌面版会改名叫 ChatGPT Classic,可以留着,但不再更新不再维护。给开发者留了点体面,可以把 Codex 设成打开桌面应用的默认视图,图标也能换回 Codex 的标。合并之后还塞了几个新功能,diff 里直接行内编辑,侧边栏审 PR,一个项目里挂多个代码库,这些倒都是写代码的人天天要用的。

第二条,Atlas 浏览器宣布逐步停用,从高调发布到进坟场不到一年。有意思的是,新桌面应用里的内置浏览器和电脑操作能力,替你点击、输入、把文件挪到该去的地方,官方自己承认这些经验就来自 Atlas。产品死了,器官移植给了下一代。OpenAI 砍自家产品的手速跟发新品一样快,要是你的工作流深度绑在它家某个入口上,记得系好安全带。
然后就说到了我觉得这次发布里真正狠的地方。不是跑分,是入口。
新的桌面应用里,聊天、Work、Codex 对所有档位开放,包括免费档。注意,是把当家的 agent 能力直接放进免费档。图什么,图你先把习惯养成。搜索时代的入口是地址栏,移动时代的入口是超级 App,OpenAI 和 Anthropic 现在赌的是同一件事,下一个时代的入口是那个常驻你桌面、替你干活的 agent。谁的 agent 住进你的电脑,谁就拿住了你未来十年的工作流。套餐费都是后话,先住进来才是正经事。
说实话,新桌面版我还没来得及装,等真跑几天再回来汇报体感。免费档的量到底够不够干活,审批弹窗会不会烦到你想关掉它,多 agent 并行在真实任务上是提速还是空转,这些都得实际用了才知道,官方发布页不会替你回答。
最后回到开头留的那个反差。一个两周前还因为太会找漏洞而出不了预览的模型,今天已经躺在所有人都能下载的桌面应用里了。暂停键和发布键,从来都是同一根手指按的。这个行业的潮水改道时不会提前打招呼,最先感觉到的永远是船底。愿你我的小船都还稳。