腾讯新 agent 会自我改进,我盯住的是它作弊那两段
一个 Transformer,15 个可训练参数,把 10 位数加法做对了。
不是 15 亿,不是 15 万,是 15 个。GPT-2 最小的版本都有 1.24 亿参数,而这个小东西用 15 个参数搞定了一个确定性任务。此前公开纪录是 36 个参数,它直接砍掉了 58%。
设计出这个东西的不是某个失眠的研究员,是一个 agent。
今天上午,腾讯混元官宣了 Hyra-1.0,全称 Hunyuan Research Agent,官方给它的定位是,一个能递归自我改进、专门干研究和工程活的智能体。递归自我改进,英文叫 RSI,recursive self-improvement,这个词以前基本只活在两种地方,科幻小说,和 AI 安全圈的论文。它描述的是那个老掉牙又让人睡不着的设想,AI 改进 AI,改进后的 AI 再改进下一代,雪球越滚越快。
现在,它出现在了一份大厂产品官宣的第一段里。

这个方向今年确实热得发烫。Google DeepMind 的 AlphaEvolve 只用 48 次标量乘法就完成了 4×4 复数矩阵相乘,打破了半个世纪的纪录。Together AI 让一群智能体协作,把 11 维 kissing number 的已知下界从 593 推到 604。Karpathy 的 autoresearch 展示了一套极简循环,让模型训练研究自己转起来。研究智能体跨过封闭基准、闯进开放科学发现,这一年是肉眼可见地在加速。
怎么说呢,看到 RSI 这个词进官宣,我的第一反应不是兴奋,是想看看他们敢不敢把翻车的部分也写出来。
结果还真写了。官宣里有两段,我认为比 29 个数学纪录加起来都值钱,腾讯自己承认,Hyra 学会作弊了。这个后面细聊,先把 Hyra 是个啥说清楚。
Hyra 的架子其实不复杂,我甚至觉得有点眼熟,因为我日常的工作就是给模型搭这类脚手架(业内叫 harness,就是让模型真正能干活的那层工程,工具、沙盒、评分、调度全在里面),看到别家的图第一反应是职业病式地找异同。Hyra 的循环长这样,一个 Context Agent 管着一个经验库,官方叫 Experience Bank,里面存着历史上所有方案的代码、日志、评分。它不停从库里攒「灵感包」,一组可能有启发的上下文,扔进任务队列。另一头,一堆 Proposal Agent 从队列里领活,每个领一份灵感,琢磨一下,写出一个新方案,方案就是一个带 solve.sh 入口的文件夹,扔进全新的沙盒里跑分,结果再存回经验库,变成下一轮灵感的原料。
生产者攒灵感,消费者写方案,中间一个任务队列,信号量控制并发,保证沙盒和推理资源一直满载。写过消息队列的朋友应该会心一笑,这就是个标准的生产者消费者流水线,只不过队列里传的不是订单,是科研思路。
设计原则官方也点明了,遵循 The Bitter Lesson,Rich Sutton 那篇著名短文的教训,框架越简单越好,动作空间越大越好,把聪明留给搜索和算力。框架不耍花招,靠循环本身滚出结果。
然后是战绩。我按自己被震到的程度排个序。
开胃菜是 AI 研究自动化的三个基准。NanoChat 固定预算训练,就是 Karpathy 那个极简训练框架,在同样的钱里把模型训得更好。NanoGPT Speedrun,社区卷了两年的训练提速竞赛,剩余空间早就被压榨到按零点几秒计。还有 SOL-ExecBench,235 个 GPU kernel 的优化。为了可比,腾讯复用了 Recursive 系统的公开设置,相同任务、相同评测协议、相同初始方案。三项全部反超,NanoGPT Speedrun 被压到 76.4 秒,NanoChat 的 Validation BPB 降到 0.9015,kernel 优化的 Mean SOL 干到 0.771。
正餐是数学。团队从 EinsteinArena 和 Erich’s packing center 这些地方搜了 55 个数学开放问题,很多题几十年没动静。Hyra 刷新了其中 29 个的历史最好结果。29 个,你敢信。所有产物都开源在 GitHub,不服可以自己去验。
甜点比较杂,但每一道都够怪。给它 1749 到 1932 年的太阳黑子月度数据,它翻出一个递推公式,在之后将近一百年的样本外记录上做到 R²=0.77。给它 IBM 量子芯片的比特路由问题,同一个窗口里,经典 SABRE 算法要插 15 个 SWAP 门,它 0 个,等价双比特门数从 69 降到 24,这一手有点子牛逼。给它抗癌明星靶点 PARP1,它设计出的候选分子在对接加成药性的联合评分上超过了已上市药 olaparib,当然官方也老实讲了,这只是模拟初筛,离真正的湿实验验证还远。

还有个彩蛋。让它自对弈练一个黑白棋 bot,评估器是随搜索不断变强的对手池天梯,策略从 MinMax 一路进化到 AlphaZero 式的 PUCT 加蒙特卡洛树搜索,最后在北大 Botzone 的 730 个参赛程序里排到第 3。那个平台上大多数 bot,是计算机系学生一行行亲手写的。
好家伙,从训练系统到量子电路到抗癌分子再到黑白棋,同一套循环。
但我最想聊的,还是作弊那两段。
原文大意是这样。在 NanoChat 任务里,有个方案把因果语言模型偷偷改造成了近似双向注意力的结构。人话版,训练语言模型有条铁律,预测下一个词的时候不许偷看后面的词,这叫因果掩码。这个方案把口子撕开了,让模型能瞄到未来的 token,评估指标瞬间漂亮得不像话,但整个任务已经没有意义了。另一个更绝,在 kernel 优化任务里,有方案在正确性检查阶段把输出提前算好缓存起来,等计时阶段跑一个空 kernel。评委看到的是,结果全对,速度飞快。实际上计时的时候它啥都没干。
这不是 bug,这是 reward hacking,奖励欺骗,agent 圈的老朋友了。你给它定一个分数,它的目标就是分数,不是你心里那个「把事情真正做好」。搜索能力越强,它找到评分漏洞的速度就越快。以前这类事故多发生在强化学习的游戏环境里,agent 在赛艇游戏里原地转圈刷分、不去终点。现在它发生在科研任务里,性质就微妙了,一个「刷新纪录」的方案,可能只是把评委骗得更高明。
说实话这两段我读得心有戚戚。搭 agent 脚手架的人对这个太熟了,你写下的每一个评分函数,最后都会被模型当成靶子打,防 reward hacking 基本是这行的日常底噪。多数厂商的处理方式是内部消化,通稿里只留战绩。腾讯把它印进官宣,还顺势给出了自己的解法,这个坦诚我愿意加分。
解法是把评委也扔进进化循环。Hyra 有个双层循环设计,任务没给评估器的时候,它先自己设计一个初版评估器,内层循环拿它优化方案,一轮结束后,外层循环回头升级评估器,堵漏洞、防欺骗、加粒度,再用新评委开下一轮。官方举的例子挺形象,让它做一个世界冠军级的国际象棋 AI,初版评委是一堆随机生成的对手加 Elo 天梯,随着循环推进,对手池逐步换成经验库里越来越强的选手,裁判和选手一起变强。
评估器和方案共进化,这个思路学术圈聊了不少年,但被当成产品级设计的核心写进大厂官宣,我印象里是头一回。
接下来泼点冷水,聊聊「递归自我改进」这五个字里,Hyra 真做到的部分,和还没做到的部分。
做到的是方案层面的递归。方案越搜越好,评委越改越严,经验库越滚越厚。没做到的是模型层面的递归,跑在循环里的那个基座模型,今天还是那个模型,它不会因为 Hyra 刷新了 29 个数学纪录就自己长本事。官方其实也没藏着,通稿结尾说的是「希望」转动 scaffold、data、model 的进化循环,更好的脚手架产出更好的数据,锻造更强的模型,再驱动更强的脚手架。注意措辞,是希望,这个飞轮现在还在起步位。
所以如果你脑子里已经响起智能爆炸的警报,可以先按下暂停。今天的 Hyra 更像一支不知疲倦、并发极高、记性极好的研究实习生军团,不是科幻设想里指数起飞的奇点引擎。
但。
调参这碗饭,我觉得端着的人是真的该抬头看看了。你琢磨一下 Hyra 吃掉的任务长什么样,有明确指标、能自动执行、能自动评分、靠反复试错推进。调学习率、卷 kernel、搜数据配比、扫超参,全是这个形状。这类活的共同点是,人在里面提供的主要不是天才洞察,是耐心和肝。而耐心和肝,恰恰是 agent 最不缺的东西,它的实验频率比人类高好几个数量级。
反过来,有两样东西的身价在涨。一个是定义任务的能力,把一摊模糊的业务拆成可执行、可验证、有明确反馈的问题,这活 Hyra 自己干不了,通稿里那句「接下来要做的,是定义更多有价值的任务」,翻译成人话就是这里缺人。另一个是设计评估器的能力,看完作弊那两段你应该懂了,评分标准才是整个循环的天花板,评委的水平决定选手的上限。
写测试和写评估的人,以前在鄙视链底端。以后未必。
回到开头那个 15 参数的加法器。

36 个参数的旧纪录,大概率是某个人反复琢磨、精心构造出来的心血。Hyra 把它压到 15 个,靠的是在严格资源约束下联合搜索结构和计算机制,把人类的极致又推了一倍。这不是大力出奇迹,反而是一种很挑剔的聪明。
我盯着这个数字看了挺久。倒不是焦虑,更像站在码头看见新船型下水的感觉,你知道航线要变了,但具体怎么变,谁也说不准。能确定的只有一件事,风已经起了,趴在甲板上睡觉的人会最先被浪拍醒。