Google 悄悄开源的这个库,比发三个模型更值得看

小岛AI 2026 / 07 / 21

昨天大家的目光都在 Gemini 三连发上,同一天 Google 还干了件动静小得多的事,把一个叫 Tunix 的库开源了。我翻完文档想说,这个库比那三个模型更值得看。

Tunix 是个专门做大模型后训练的库。后训练这个词圈外朋友可能陌生,展开讲一下,它可能是 AI 圈进步最快也最玄的部分。

预训练出来的模型,是个只会续写的机器,你说上半句它接下半句,仅此而已。把这台续写机器变成能听懂指令、会用工具、知道什么话不该说的助手,靠的全是后面这道工序,先用示范数据教它做事,行话叫 SFT,再用人类偏好把它掰正,就是常说的 RLHF 那一套。你现在用的所有能聊天能干活的模型,本事全是后训练给的。

而这道工序,一直是大厂的核心机密。论文里给你看个损失函数,给你报个最终分数,中间那些真正决定成败的实现细节,学习率怎么调、奖励怎么归一、rollout 怎么并行,从来都在黑箱里。想自己动手的人,只能对着论文猜,对着开源社区的第三方复现摸。

Tunix 把这套东西摆上了台面。SFT 有官方训练器,偏好调优给了 DPO,就是那个不用单独训奖励模型的省钱路线。强化学习这块最全,PPO,教科书级的 actor-critic 老将,GRPO,免掉 critic 模型的高效新贵,DeepSeek 把它带火之后各家都在用,还有更新的 GSPO。连知识蒸馏,拿大模型当老师教小模型,都有现成模块。

最让我坐直的是 agentic RL 这部分。多轮 agent 和环境的交互训练、工具调用、异步 rollout,全都原生支持。这已经不是聊天模型的训练库了,是照着训 agent 去设计的。模型怎么在一连串工具调用里学会把任务干完,这件事的官方参考实现,以前你在任何地方都找不到。

而且它是白盒设计,模块化、代码可读可改,不是那种封装到你看不见内部的黑箱。

Tunix 一口气备齐的后训练方法,基本覆盖了当下主流路子

说下我自己为什么盯着 agentic RL 这块看。我平时的活是给 agent 搭运行的脚手架,天天看它们在生产环境里翻车,现在业内让 agent 变可靠的主流手段,还是在推理侧打补丁,prompt 写得更细、失败了兜底重试、外面再包一层校验。这些补丁有用,但治标。真正的治本是把会用工具、会把多步任务干完这件事,在训练阶段就刻进模型里。agentic RL 干的就是这个。这条路以前只有大厂内部走得通,现在参考实现开源了,路灯算是亮了。

对做训练的人,这个库还有一层特别的意义,它是 JAX 原生的。JAX 是 Google 自家的计算框架,跑 TPU 的标配。过去几年后训练的好工具几乎全长在 PyTorch 那边,trl、axolotl、unsloth,JAX 和 TPU 用户在后训练这件事上长期是二等公民,想跑个 GRPO 得自己从论文抄起。Tunix 把这个空补上了,Gemma、Llama、Qwen 系列都直接支持。

过去后训练好工具全在 PyTorch 那边,JAX 侧长期是零

但我想说的重点不是拿来跑,是拿来读。

说实话,大多数读这篇文章的人,包括我自己,日常都碰不到从头跑 PPO 的场景。可这不妨碍这个库值钱。每一个后训练算法,现在都有了一份 Google 工程师写的、生产级的参考实现。GRPO 到底怎么归一化奖励,PPO 的优势函数在代码里长什么样,异步 rollout 的队列怎么设计,这些以前要靠猜的东西,现在是能逐行读的源码。一份活的教材,比十篇讲解文章都值钱。

昨天我写 LoRA Speedrun 的时候说过一个观察,竞速榜的每条纪录都必须开源可复现,等于有人排队给你演示每个技巧的真实收益。Tunix 是同一个趋势的另一面,炼丹这门手艺的秘方,正在被系统性地摊开、写进公开代码。两年前你想搞懂 RLHF 的工程细节,得进大厂;现在丹方和丹炉都开始摆在明面上了。

为什么大厂愿意干这种事。我的理解是,一旦有人公开,壁垒就塌了一半,与其守着迟早守不住的秘密,不如开源换生态,把开发者拉进自己的框架和硬件里。Google 这步棋明显是想给 TPU 生态补课,顺便在 PyTorch 一统天下的训练圈里抢回一点话语权。动机不重要,重要的是我们这些看客白捡了教材。

冷水两瓢照旧。第一,JAX 生态对多数 PyTorch 用户是实打实的门槛,函数式的写法、不一样的调试体验,别指望周末上手。没有 TPU 的个人用户,收益也会打折,虽然 GPU 上也能跑。第二,这是 v0.1.0,首个公开版,API 随时可能变,拿它读原理稳赚,拿它上生产,再等等。

想动手的朋友,路径也简单。pip 就能装,模型侧 Gemma、Llama、Qwen 都有现成接入,文档在 readthedocs 上很齐。我的建议是别一上来就跑全流程,先挑一个你最好奇的算法,比如 GRPO,把它的训练循环从头到尾读一遍,搞清楚每个张量在算什么,这一遍的收获就够回本了。

但就算你一行都不打算跑,把仓库 clone 下来读一遍 GRPO 的实现,也比再刷十条发布会新闻有营养。发布会散场之后,改变行业的往往是不上头条的东西。

模型是租来的,手艺是自己的。这个库教的是手艺。