起个大早赶晚集的 Google,昨晚甩出了一个世界模型

小岛AI 2026 / 05 / 20

昨天 Google I/O 开完,我的时间线就没消停过。

各种 demo 视频满天飞,Gemini 这个、Gemini 那个,发布密度高到你会怀疑 Google 是不是把攒了一整年的东西一次性全倒了出来。坦率讲,刚开始刷的时候我是有点麻的。发布会嘛,每年都那个调调,模型更强了、参数更大了、benchmark 又屠榜了,听多了耳朵会起茧子。早上的咖啡还没喝完,我已经准备划走去干活了。

直到我刷到一条推文。

德国那位常年蹲在 AI 圈门口的老哥 Kim,发了一句话,说这次真正的 wow 时刻是 Gemini Omni,一个迈向 AGI 的世界模型,可以从任何输入创造任何内容,太疯狂了(原推)。

我盯着 world model 这两个词看了好几秒。

好家伙。

世界模型这个词,不天天泡 AI 圈的朋友第一次看到可能有点懵,我用大白话讲一下它跟我们熟悉的那个文生视频差在哪。我们平时聊的文生视频,比如 Sora 那一类,干的活儿就是,你丢一段文字进去,它吐一段看起来挺真的画面出来。它在意的是这一帧像不像真的、下一帧接得顺不顺、光影对不对。它是个很厉害的画师,但它不太关心画里那个世界讲不讲道理。

世界模型想干的事情更狠。它不只想画得像,它想搞懂这个世界是怎么运转的。Sundar Pichai 自己在发布的时候说,Gemini Omni 不光能构建逼真的场景,还能推理接下来应该发生什么(Sundar 的原推)。

能推理接下来会发生什么,这就不是在画画了。这是在脑子里建了一个小世界,里面有重力、有因果、有物体之间该怎么互相作用。你往里丢个球,它知道球会往下掉、会弹、会停下来;你推一下桌上的杯子,它知道杯子会翻、水会洒、洒了之后桌面是湿的。它把对物理世界的直觉,跟 Gemini 本来就有的那一肚子历史、科学、文化知识缝在了一起。

这是两种东西。一个是画得逼真,一个是懂得这个世界。

一个装着可运转世界的模型,里面有重力、因果和物体之间的相互作用

Google AI 官方的说法更直接,Gemini Omni 是一个能从任意输入创造任意内容的新模型,先从视频开始,你可以把图像、视频、文本揉在一起当输入,它生成的是基于 Gemini 现实世界知识的高质量视频(Google AI 的介绍)。注意那半句,基于现实世界知识。它不是凭空捏一段好看的画面,它是带着对世界的理解去捏的。

我说我为什么对这个点上头。

做过一点 AI 视频的朋友都知道,现在这些工具最让人头疼的不是画质,画质早就够用了。最头疼的是角色一致性。你让它生成一个穿红衣服的女孩走进咖啡馆,下一个镜头她可能就变了张脸,红衣服变成了橙色,手里的咖啡杯凭空消失。因为模型不真的知道这是同一个人、同一个杯子,它只是每一帧都在重新猜。

而 Google DeepMind 这次把 Gemini Omni 接进了他们的视频创作工具 Google Flow,专门点名了批量编辑和改进的角色一致性(DeepMind 的演示)。角色一致性能上去,恰恰是因为模型脑子里有了那个稳定的小世界,它知道这是同一个人,所以她不会无缘无故换脸。这条线是对得上的。

聊到这儿,我得把一个不太好意思的事实摆出来。

Google 在生成式 AI 这件事上,是出了名的起个大早赶晚集。

ChatGPT 火遍全球那阵子,Google 内部据说拉过红色警报,急吼吼推出来的东西被嘲了个遍。更尴尬的是 2023 年底那次 Gemini 的演示视频,号称实时多模态交互,结果被扒出来是剪辑加速、提示词喂了又喂的产物,社区里骂声一片。那阵子你要说 Google 在 AI 上能翻盘,多少人会冲你翻白眼。

所以这次我特意多看了几眼,心里还揣着点防备。Google 的 demo 嘛,懂的都懂,剪辑师的功劳有时候比模型大。

但这次的盘子,确实铺得不一样了。

它不是发了一个孤零零的牛逼模型就完事,它是把一整条线从头到尾全都连了起来。

先看搜索。搜索是 Google 的命根子,也是它过去两年被 AI 冲击得最厉害的地方,多少人嚷嚷着以后不用搜索引擎了,直接问 AI。Google 这次的回应是,把 AI Mode 的默认大脑换成了 Gemini 3.5 Flash,主打 agent 和编码的持续前沿性能(agent 这个词后面会反复出现,先记一下,指那种能自己规划、自己动手、替你把一连串事情干完的 AI,不是只会一问一答的那种)。

然后它放了个数字,AI Mode 推出才一年,月活已经过了 10 亿,查询量每个季度翻一倍(Google 官方博客)。

10 亿月活。这个体量你品一下。多少 AI 创业公司削尖了脑袋抢用户,Google 在搜索这个老阵地上轻飘飘地就是 10 亿。

更狠的还在后面。Google 说这是 25 年来最大规模的搜索框升级,新搜索框能动态扩展来描述你的需求,而且支持多模态输入。多模态这个词,圈外朋友理解成一句话就行,文字、图片、文件、视频,甚至你浏览器里正开着的那个 Chrome 标签页,都能直接丢进去当搜索内容,让它跨着这些东西一起推理。

它还塞进去三个 agent。一个信息代理,能全天候帮你扫网络,盯着你关心的事一有动静就告诉你;一个预订代理,覆盖本地的体验和服务,今年夏天先在全美铺开;还有一个代码代理,能在搜索结果里实时拼出组件,给你生成个自定义的小界面甚至迷你应用。

你搜个东西,它顺手给你写了个 app 出来。

我看到这儿愣了一下。这已经不是搜索了。

接着是 Gemini 这个 app 本身。Google 这次给它的定位变了,从一个回答你问题的助手,变成一个在你指导下、代表你去把活干完的助手。具体的产品叫 Gemini Spark,全天候的个人 AI 代理(Gemini 官方)。还有一个我个人挺想用的,叫 Daily Brief,每日简报,它从你的收件箱、日历、待办里把信息扒拉出来,排好优先级,早上给你一份特别简洁的晨间摘要,顺带建议你今天第一步该干啥(Daily Brief 介绍)。

说真的,这个我是有点心动的。每天早上打开电脑前那十分钟,邮件、日历、群消息来回切,光是搞清楚今天到底要干嘛就够呛。如果真有个东西能先帮我把这堆东西捋一遍,那确实省心。当然了,这种功能 demo 里永远岁月静好,真用起来会不会变成又一个准点给你推没用通知的玩意儿,得用了才知道。我先把期待值压一压。

再往上是规模。Gemini 这个 app 现在月活超过 9 亿(Gemini 年度回顾)。搜索那边 10 亿,app 这边 9 亿,这俩数字摆在一起,你大概能感觉到 Google 手里那张分发的牌有多厚。

然后是钱。Google 顺手把订阅体系也理了一遍(订阅说明)。新出了一档 AI Ultra,每月 100 美元,定位是入门级的高级档,给开发者和技术工作者,包含 5 倍的 Gemini app 用量、Gemini 3.5 Flash、20TB 云存储,还搭了个 YouTube Premium。原来那个顶级档降价到 200 美元一个月,给到 20 倍用量、Gemini Spark 和 Project Genie。最关键的一条是,连相对便宜的 AI Plus 和 AI Pro 都能用上 Gemini Omni 和 3.5 Flash。

把刚发布的世界模型直接下放到中低档订阅,这个动作不小。

最后是给我们这帮写代码的。Google 推了个叫 Antigravity 的开发平台,主打 agent-first,给那些要构建或者编排智能体的开发者用(Antigravity 介绍)。同时它宣布把社区用的 Gemini CLI 迁到全新的 Antigravity CLI,用 Go 重写,agent 优先,支持复杂的多代理工作流,跑得更快(迁移公告)。

你看出来这套组合拳的形状了吗。

模型,是 Gemini Omni 这个世界模型;入口,是 10 亿月活的搜索加 9 亿月活的 app;变现,是重新理过的订阅三档;开发者,是 Antigravity 这套从平台到命令行的全家桶。从最底下的模型,到最上面用户每天点开的那个搜索框,到我们这些开发者写代码的工具,Google 这次是一根线从头串到尾。

这就是我一开始麻、后来坐直了的原因。单看任何一个发布都不算石破天惊,文生视频别家也有,AI 搜索别家也在做,agent 满世界都在喊。但当一家公司能把这些东西全摆在同一张桌子上,而且每一个背后都站着十亿级的用户,那个分量就完全不一样了。

而且 Google 这场仗,不是在真空里打的。

就在同一周,OpenAI 那边宣布推出 Guaranteed Capacity,一项让客户锁定长期算力供给的服务,摆明了是在替那些要大规模扩张的大客户兜底;他们还顺手晒了个数字,现在人们每周在 ChatGPT 里生成的图片超过 15 亿张(OpenAI 的推文)。15 亿张,一周。xAI 那边也没闲着,把 Grok 接进了一个叫 OpenClaw 的开源本地优先助手,往开源和端侧的方向探(xAI 公告)。连 Anthropic 都在调整方向,Claude Code 团队正从 Markdown 切到 HTML 当主要输出格式,理由是 HTML 在信息密度和交互上能装下更多东西。

你把这一周拼起来看,每一家都在往前拱,只是节奏和打法不同。站在独立开发者的位置上回望这七天,多少会有点四面合围的感觉。

聊到这儿,我得停下来说点不那么 happy 的。

如果你是个独立开发者,或者在做一个 AI 方向的小创业,看完这场发布会,你大概率不会兴奋,你会有点慌。

我特别能理解这种慌。你不是什么大厂的 AI leader,你可能就是一个攒了点钱、组了个三五人小队、押注在某个细分场景上的人。你做的可能是一个 AI 视频工具,或者一个帮人整理邮件日历的助手,或者一个更聪明的搜索。这些方向你都研究透了,产品也打磨得不错,用户口碑也在慢慢起来。

然后 Google 一场发布会,把你做的那件事,当成它几十个更新里的一个小条目,轻飘飘地讲完了。而且它背后是 9 亿、10 亿的用户,是别人想都不敢想的算力,是免费或者顺带就送的定价。

这种感觉,怎么说呢,就像你在一座小岛上辛辛苦苦盖了座灯塔,结果一抬头,发现整片海岸线一夜之间立起了一排探照灯。

我没法跟你说一句别怕,那太轻巧也太不负责任了。巨头把场景一个个收进自己的全家桶,这件事是真的,独立产品的活路被挤窄,也是真的。这两年我们见过太多小工具,做得很好,最后死在大厂一个顺手的功能更新上。

但我自己一直信一件事,可能不太成熟,你听个意思。

巨头永远在做最大公约数。Google 这套东西的厉害之处,恰恰也是它的边界,它要服务的是全球十亿级别、98 种语言、几乎所有人的通用需求。它做的是那个对所有人都还行的东西。而真正具体的、深的、带着某个行业某个人群体温的需求,巨头是顾不过来的,它的产品经理排期表上排不到你那个细分场景。

世界模型再强,它也不懂你那个做小众播客后期的用户半夜在为一段三秒的转场抓狂;Daily Brief 再贴心,它也不知道某个行业的人早上第一件事其实是看一个特别冷门的数据看板。这些缝隙,是巨头的盲区,也是还活着的人的氧气。

所以这场发布会对我们普通玩家真正的信号,不是别人都做完了你别玩了,而是水位又被抬高了。以前能靠一个套壳应用混口饭吃,现在不行了,因为套壳这层 Google 顺手就给你抹平了。能活下来的,是那些真的钻进了某个具体场景、跟用户一起在泥里打滚、把那一个点做到巨头懒得做也做不到那么深的人。

门槛抬高,对认真做事的人,未必是坏事。它把浑水摸鱼的那一批先冲走了。

回到 Gemini Omni 本身。我现在还没拿到手实测,按惯例,发布会上的丝滑和你自己跑起来的卡顿之间,永远隔着一道说不清的鸿沟,这一点我得诚实地标出来,等真上手了再单独跟你聊体感。Google 的演示我也学乖了,先打个七折看。

但 world model 这个方向,我是真觉得对。让模型不只是会模仿世界的样子,而是去理解世界的规则,这件事如果真做成了,它的影响远不止生成几段好看的视频。一个脑子里装着可运转世界的模型,往后能接到机器人上、接到科学模拟上、接到一切需要预判接下来会发生什么的地方去。

万能青年旅店有句词我一直记着,是谁来自山川湖海,却囿于昼夜厨房与爱。我们这些在 AI 浪潮里划船的人,每天追着发布会跑,盯着别人的探照灯心慌,其实很容易就囿在了这种追赶的焦虑里。但说到底,山川湖海一直都在。巨头点亮一整片海岸线,不代表海就不值得航了。它只是让你不能再贴着岸边瞎晃,得往更深、更具体、更没人去过的水域里划。

巨头点亮一整片海岸线,不代表海就不值得航了

这座小岛上,灯塔还是得自己一砖一瓦地盖。

Google 昨晚甩出来的这个世界模型,有点子牛逼,我承认。但海图还在你自己手里。

慢慢划,别慌。