posts/weathernext-cyclones-24h.md
WeatherNext 多争取 24 小时,真正难的是把预测变成预警
一套 AI 模型,把气旋预报往前推了整整一天。
不是生成天气播报,也不是把一张卫星云图说得头头是道。Google DeepMind 最新公开的 WeatherNext Cyclones,在路径、强度和风场结构三项任务上,三日预报做到了过去模型两日预报的准确度。
24 小时。
放在模型圈里,它像一行漂亮的 benchmark。放在一场正在靠近海岸的台风前面,它可能是多调一批救援物资,多撤离一片低洼社区,多检查一次医院备用电源。
好家伙,这种 AI 没有聊天框,也不会帮你润色周报,却可能比今年大多数热闹的新功能更接近「有用」两个字。
但如果文章只写到这里,还是一篇发布通稿。真正值得工程师盯住的,不是模型多猜对了一天,而是它如何表达自己也拿不准的部分,如何进入专业人员的决策流程,以及为什么 Google 在开源仓库最醒目的地方反复提醒,别拿实验模型替代官方预警。
这几件事,恰好也是所有 AI 预测系统最容易偷懒的地方。
多出来的不是一天,是一段能行动的时间
气旋预报至少要回答三个不同的问题。
它往哪里走,这是路径。它会增强到什么程度,这是强度。多大的区域会被大风覆盖,这是风场结构。
只把路径画准并不够。一条线从城市旁边擦过去,不代表城市就安全。风圈可以大到覆盖几百公里,降雨和风暴潮还会把影响继续向外推。只看强度也不够,同样级别的气旋,登陆点差几十公里,落到人口密集区和落到无人海岸,后果完全不是一回事。
过去的难处在于,这三项能力喜欢住在不同的模型里。路径受全球大气环流推动,粗一些的全球模型更会看大局。强度受气旋核心附近的海温、湿度和热力过程影响,高分辨率局地模型更擅长盯细节。一个负责看棋盘,一个负责看棋子,预报员再把两边结果拼起来。
WeatherNext 想干的事有点子牛逼。它用一个模型同时学习全球天气动力学和专家整理的历史气旋观测,让路径、强度和风场结构一起输出。训练材料包括近 20TB 全球大气数据,以及 IBTrACS 数据库里近 5000 场历史风暴。
Nature 论文评估了 2023 至 2024 年的历史气旋,并拿确定性预测和概率预测去对比领先天气模型。结果不是某一项偶尔领先,而是三类指标平均都多出超过 24 小时的有效提前量。
所谓有效提前量,不是把原本两天后的数字强行外推到第三天。它指的是 WeatherNext 在第三天的误差,已经接近传统基线在第二天的误差。Google 按过去 20 年的进步速度估算,这一跳大约相当于十年的气象预报进展。
这个表述很关键。模型不是凭空发明了一天,它把同等可信度的判断更早交了出来。

蓝线为 WeatherNext Cyclones,横向箭头表示约 24 小时的有效提前量
对业务系统来说,提前量只有接上行动链才值钱。仓库调度需要知道何时转移物资,电网需要知道哪一片线路先加固,医院需要知道备用电源按多久准备,基层人员需要知道什么时候开始逐户通知。模型输出早了 24 小时,流程却还要开两轮会才能拍板,那这一天照样会被吃掉。
很多 AI 项目也卡在这里。离线评测涨了 10 分,线上工单没有少一张。预测准确率看着挺漂亮,运营同事却不知道哪条结果值得信。不是模型没进步,是模型和行动之间没有设计好接口。
WeatherNext 最值得看的地方,正在这个接口上。
它没有押一条路线
天气不会因为模型想要一个干净答案,就老老实实只走一条路径。
WeatherNext 交付的不是一条自信满满的红线,而是一组可能发生的未来。它使用功能生成网络,也就是 Functional Generative Networks,快速生成预测集合。每一条都代表在当前大气状态下可能出现的一种演化。
去年,系统一次生成 50 条预测,规模与全球物理模型相当。今年,这个数字扩到 1000 条。单个 15 日预测在一张 TPU 上不到一分钟,计算预算于是可以花在更多情景上,而不是只算一条看起来最像答案的路线。
1000 条可不是为了把图画得更热闹。

1000 个集合成员被汇总为不同风级的概率分布,来源 Google DeepMind
气旋快速增强往往属于低概率、高后果事件。大多数情景可能都显示它会平稳发展,只有少数几条突然拐向危险区间。如果系统只返回平均值,那些真正需要提前准备的尾部风险很容易被抹平。平均身高可以拿来订门框,平均台风可没法拿来撤离。
2025 年飓风 Melissa 就是现实检验。按 Google DeepMind 公布的复盘,模型较早捕捉到它快速增强并在牙买加登陆的可能性。美国国家飓风中心把模型作为多项证据之一,结合专业判断发出预报。
注意,是证据之一。
它没有越过预报员直接给居民发通知,也没有用一个概率替人拍板。模型负责把原来不容易看见的风险摊开,专业人员负责判断数据质量、比较其他模型、结合现场观测,再决定怎样对公众表达。
这套分工一点都不科幻,甚至有点朴素。可它比不少 Agent 产品成熟。很多系统还在努力把不确定性藏起来,生怕界面上出现一个「我不确定」显得模型不够聪明。WeatherNext 反过来,把不确定性当成主要产物。
我自己的判断是,预测型 AI 最重要的输出格式不是答案,而是答案、概率、条件和退出机制一起交付。只给一个结论,就像接口永远返回 HTTP 200,至于里面的数据是不是坏了,全靠调用方猜。厉害了,演示时一片绿色,上线后大家一起看日志发呆。
如果把 WeatherNext 的思路搬到普通业务里,一个风控模型不能只说拒绝,它还要告诉你风险来自哪些信号,置信区间多大,遇到数据缺失时是否自动转人工。一个销售预测模型不能只给下季度数字,还要给关键假设和上下界。一个代码 Agent 不能只说测试通过,还要说明跑了哪些测试、哪些环境没覆盖、哪里需要人看一眼。
不是每个场景都需要 1000 个答案,但每个高风险场景都该认真对待第二种可能。
28 公里的网格,居然够用
论文里还有一个很容易被跑分新闻盖过去的细节。
WeatherNext Cyclones 的输入分辨率约为 28×28 公里,比传统高分辨率气旋模型粗约 100 倍。按常识,想看清气旋眼墙附近剧烈变化,网格当然越细越好。结果它在这么粗的输入上,依然把强度和风场结构做到了领先水平。
团队自己也承认,目前还不能完全解释原因。
这句「还不知道」反而很重要。它把能力边界摆在桌上,没有因为结果好看就顺手编一套漂亮故事。机器学习模型可能从大量全球状态与历史风暴中学到了跨尺度关联,粗网格里那些看起来不够细的信号,组合起来也许足以推断局部变化。但推断机制到底稳不稳,碰到训练分布外的海域和极端气候是否还成立,仍然需要研究。
说真的,这比「参数更大所以更聪明」有意思多了。
更粗的输入直接改变了工程成本。分辨率提高一倍,不只是图片宽高多一点,空间网格、时间步和变量数量会一起推高计算与存储。WeatherNext 用较粗输入保持效果,就能在同样预算里运行更多集合成员,去覆盖那些少见但要命的分支。
这是一笔很现实的账。你可以把算力花在一张极细的确定性地图上,也可以花在 1000 个略粗但彼此不同的未来上。前者适合展示,后者更适合做风险决策。
当然,粗网格并非万能。局地暴雨、山谷风、城市内涝和风暴潮会受到地形、海岸线与城市结构影响,全球模型很难直接替代区域预报。WeatherNext 官方也没有这么吹。它开放模型,是希望研究机构继续做本地化和专业化,而不是让所有气象部门删掉现有系统,改成一条 Google API。
这份克制值得留意。真正进入生产的 AI,很少靠一个模型通吃。更常见的形态是全球模型给背景场,区域模型补局部细节,实时观测持续校正,规则系统处理硬约束,专业人员负责最终发布。听着不如端到端三个字性感,但灾害预警又不是融资路演。
开源不等于拿来就能报天气
Google DeepMind 这次把 WeatherNext 官方仓库整体打开了,代码采用 Apache 2.0 许可,模型和资料也给出开放使用路径。仓库里有 WeatherNext 2、论文对应的 WeatherNext Cyclones,以及更小的 Mini 版本。
Mini 可以在免费的 Colab Notebook 里跑,官方建议使用 v5e-1。完整版本优先针对 TPU 优化,放到 GPU 上要切换 attention 实现,非 Mini 模型还需要 H100 级显存。训练则要面对 ERA5、HRES 这类庞大气象数据和各自的许可条件。
所以,开源之后最先消失的是研究门槛,不是生产门槛。
普通开发者今天可以跑通样例,加载初始天气状态,做自回归 rollout,画温度、风速和位势高度,再用 tracker 提取气旋轨迹。棒棒的,这已经足够教学、复现和二次研究。
可要把它变成一个敢对公众负责的预警系统,还差数据接入、持续校准、区域适配、故障回退、版本锁定、审计记录和发布权限。仓库也写得很诚实,研究代码不保证 API 稳定,未来更新可能带来破坏性变化,建议固定版本。模型不是任何政府气象机构的正式产品,也不能替代官方警报。
这不是免责声明里例行公事的一句废话,而是产品边界。
高风险系统最怕的并非模型偶尔犯错,而是组织不知道模型会在哪些地方犯错。一次权重更新让某类气旋表现退步,谁能发现。初始场数据晚到三小时,系统是继续出图还是停止。1000 条情景突然收敛成一条,代表天气真的稳定,还是采样链路坏了。当地观测与模型明显冲突时,谁有权限按下暂停键。
这些问题都不会在模型卡的平均分里自动回答。
做过线上系统的人看到这里应该很熟。真正费时间的永远不是 demo 第一次跑通,而是让它第二百次、两千次跑坏时,也能留下证据,自动降级,并把人叫回来。
不能删掉的那一层,是人
Weather Lab 已经能浏览最新气旋轨迹、温度、降水和风速预测。对普通人来说,这是一扇很酷的窗口。对专业预报员来说,它只是工具箱里新添的一件工具。
我挺喜欢官方文章结尾那句提醒,正式天气预报和警报,请以当地气象机构或国家气象服务为准。
它没有削弱 WeatherNext 的价值,反而把价值放对了位置。
模型把 24 小时交给人,人再把这 24 小时变成撤离路线、物资清单、停课通知和设备检查。1000 条未来不是让人陷入选择困难,而是让那些代价巨大的小概率分支有机会被看见。预报员也不是 AI 还没成熟时临时放在旁边的安全员,他们负责把数据、当地经验和公共责任接在一起。
所有想把 AI 接进真实业务的人,都可以从这里抄一份作业。
别只交一个答案,交付不确定性。别只测平均表现,盯住高后果尾部。别把人工复核画成迟早要删除的方框,把它当成系统架构的一部分。别让模型升级直接越过版本、评测和回退流程。
WeatherNext 多争取的那一天,到头来不是写在论文里的 24 小时。
是风还没到,行动已经开始。