GLM-5.2 开源:国产模型在 Code Arena 干到全球第一

小岛AI 2026 / 06 / 17

今天早上刷到智谱那条推送的时候,我脑子里正在想的,恰好就是长任务跑飘这个老毛病。

你大概也碰到过这种场景。让一个 agent 自己去改一个老项目,跑着跑着就开始飘,前面读进去的约束慢慢忘光,改着改着把你之前修好的地方又改回去。盯着日志只能叹气,心想这玩意儿什么时候能真的扛住长任务,别老是跑一半就断片。

然后就看到 GLM-5.2 上线并开源了,标题写着六个字,专注 Coding 与长程任务。

我愣了一下。这不就是我刚才在骂的那个事吗。

先把最炸的一条放这儿。在一个叫 Code Arena 的前端开发盲测系统上(全球上百万用户参与,盲投,你不知道屏幕上这段代码是哪个模型写的,纯凭好坏投票),GLM-5.2 拿了全球可用模型第一。

不是国产第一,是全球可用模型里第一。

我第一反应是有点子不敢信。这两年我们已经习惯了一个心理排序,闭源天花板在 Claude 和 GPT 那边,开源追在后面喘气,国产开源再往后排一档。结果智谱这一下,直接把这个排序给捅了。

先说让我没绷住的那段

我去翻了它的基准数据,越看越觉得有意思。

智谱自己很坦诚,没藏着掖着。它说 GLM-5.2 在多个长程任务基准上,表现介于 Claude Opus 4.7 和 4.8 之间,是排名最高的开源模型。注意这个措辞,介于 4.7 和 4.8 之间,意思是还没追平最新的 Opus 4.8,但已经把 4.7 甩在身后了。

具体到几个点。FrontierSWE,这是个考你能不能像个软件工程师那样、在几个小时的尺度上啃完一个复杂技术项目的测试集。GLM-5.2 在这上面只比 Opus 4.8 低 1%,比 GPT-5.5 高 1%,比 Opus 4.7 高了 11%。

Terminal-Bench 2.1,考的是 agent 在终端里干各种活的能力,比 Opus 4.8 低 4%,但相比自家上一代 GLM-5.1 提升了 17.5%。

MCP-Atlas,大规模工具调用的评测,比 Opus 4.8 低 0.8%。

你把这几个数摆一起看,会发现一个很妙的位置。它没吹自己天下第一,全程在跟 Opus 4.8 这个当前公认的顶配掰手腕,差距是 1%、4%、0.8% 这种量级。这种差距在实际写代码的时候,很多时候是体感不出来的。

当然它也有露怯的地方,这点我反而更欣赏。SWE-Marathon,专门考 agent 自己一个人闷头干超长软件工程的,GLM-5.2 比 Opus 4.8 低了 13%,差得不少。智谱直接写在公告里,说这块确实还需要进一步提高。

厉害了,一个公司能在发布日把自己短板的具体数字写出来,这事本身就比那一堆遥遥领先的形容词可信多了。

1M 上下文这块,是真下了功夫

GLM-5.2 主打的是长程任务,而长程任务的地基是上下文窗口。

它说自己做到了 Solid 1M 无损上下文。1M 就是一百万 token 的上下文窗口,token 你可以粗暴理解成模型眼里的一个字或半个词,一百万 token 大概能装下一整个中型项目的代码加上来回的对话历史。

但这里有个坑,业内都知道。很多模型号称 1M 上下文,实际上塞过几十万 token 之后就开始劣化,前面的东西它嘴上说记着,实际上已经糊成一团了。这就是我开头那个 agent 跑飘的根本原因,窗口大不等于真的记得住。

智谱说他们花了几个月专门扩展 1M 的 Coding agent 训练环境,覆盖自动化研究、性能优化这些场景,让模型在接近一百万 token 的长度上还能稳住,有些时候表现甚至超过 Opus。

光说没用,它甩了个真实案例。GLM-5.2 完整交付了一个覆盖 Web、移动端和小程序的多端应用,从开发、联调、测试一路到打包上线,累计处理了 88 万 token,几乎把那一百万的窗口用满了。

我看到这个数字停了一下。88 万 token 是什么概念,这相当于把一个过去得好几个人协作好几周的工程,塞进了一条不断线的推理链路里跑完。中间不重开会话,不丢上下文,一口气走到底。

这才是长程任务真正的意思。不是聊得久,是干一件大事的时候,脑子从头到尾不断片。

还有一个更野的案例

它放了个我看完想转发的例子。

有开发者用 Rust 从零再造了当年送人类上月球的那台计算机,把阿波罗那套六万五千行、几十年一字未改的登月飞控程序,整个移植成了 Rust。而这整个过程,是 agent 全自主走完的。

六万五千行飞控代码的移植,全自动。

我盯着这条看了好一会儿。这不是写个 todo list demo,这是把人类航天史上最硬核的一段遗产代码,交给一个开源模型自己去啃。能跑下来,说明它的长程稳定性和对复杂工程的承载,确实到了一个新的位置。

阿波罗那批工程师当年是怎么把这套东西编织进绳子存储器里的,现在一个模型自己就把它翻译了一遍。我不知道该说什么,就是有点恍惚。

底下的工程,才是真功夫

聊点偏工程的,这部分是我个人最感兴趣的,毕竟我平时干的就是给模型搭让它能真正干活的那层脚手架。

GLM-5.2 的提升不是单纯堆参数堆出来的,是模型架构、推理系统、训练基础设施一起协同设计的结果。

它提出了一个叫 IndexShare 的东西,简单说就是在每四层稀疏注意力层之间复用同一个索引器,这样在 1M 上下文长度下,把每个 token 的计算量降到了原来的 2.9 倍这个水平(注意力的开销本来是随长度爆炸增长的,能压到这个倍数已经很省了)。

还有投机解码这块。投机解码你可以理解成模型生成的时候先让一个小模型快速猜几个词,大模型再批量验证,猜对了就省时间。GLM-5.2 改进了相关的 MTP 层,把猜中接受的长度最多提升了 20%,直接体现在你用的时候它吐字更快。

训练侧靠自研的 Slime 框架撑大规模的 agent 强化学习。

但真正让我觉得有点子牛逼的,是它的 Infra 适配。GLM-5.2 在 Day 0,也就是发布当天,就完成了和华为昇腾、平头哥、摩尔线程、寒武纪、昆仑芯、沐曦、海光、壁仞这一长串国产算力平台的推理适配,在国产芯片集群上跑出高吞吐低延迟。

好家伙,这个名单我数了数八家。一个开源模型发布即在八家国产芯片上跑通,这背后是多少联调的活儿,我光是想想那些对齐算子、调显存、抠延迟的夜晚就头皮发麻。这种活我太熟了,一个芯片适配顺利能搞一周,八个还要赶在发布日,这工作量不是闹着玩的。

MIT 协议,这四个字分量很重

最后说说开源这件事。

GLM-5.2 在 Hugging Face 和 ModelScope 开源,权重用的是 MIT License。MIT 是开源协议里最宽松的那一档,意思是你可以自由下载、自由部署、自由商用,几乎没有附加条件。vLLM、SGLang、transformers 这些主流推理框架已经支持了。

智谱公告里有句话,叫无地域限制,技术平权无国界。

这句话放在今天这个节点上,听着是有点重量的。就在这两天,还有海外的模型因为各种管制原因,被要求限制某些地区的人访问。一边在收紧、在筑墙,一边把最强的能力之一用 MIT 协议摊开放在桌上,谁都能拿。

我不太想拔太高,但这种对比本身就挺有意思的。技术这东西,藏起来是一种选择,摊开也是一种选择,而摊开的那一方,往往最后赢得更多的人。

我自己打算怎么用

说回开头那个跑飘的毛病。

我大概率会把 GLM-5.2 接进流程里试一轮。倒不是因为它便宜(它确实在 GLM Coding Plan 里全量开放了),而是它那个 1M 稳定上下文和长程不跑偏的特性,正好戳在最痛的点上。这类自动化流程最怕的就是任务跑到一半模型忘事,前功尽弃。

它还有个 effort level 的设计,就是思考档位,让你在能力、速度、成本之间自己调。这个我喜欢,因为真实的工程里不是每个任务都值得用最贵的算力去想,能按需调档是省钱的关键。

我也不确定它在我的实际任务上能不能打过我现在用的方案,这得真跑了才知道,体感这东西基准跑分替代不了。但至少,现在我手里多了一个开源的、MIT 的、能装下整个项目还不跑偏的选项。

是谁来自山川湖海,却囿于昼夜厨房与爱。我们这些天天跟模型较劲的人,囿于的是上下文窗口和那条总会断的推理链。现在有人把这条链接长了一截,还白送给你,那就接上试试呗。

好家伙,又有得玩了。

想自己上手的,几个官方入口放这儿。

开源权重 GitHub https://github.com/zai-org/GLM-5

Hugging Face https://huggingface.co/zai-org/GLM-5.2

ModelScope https://modelscope.cn/models/ZhipuAI/GLM-5.2

技术细节看官方 blog https://z.ai/blog/glm-5.2

API 接入走 BigModel 开放平台 https://docs.bigmodel.cn/cn/guide/models/text/glm-5.2

在线直接体验 https://chat.z.ai/