AI 会在环境里越干越强,字节 EdgeBench 发现的新 Scaling Law
一个分数从 42.8 爬到 67.0,中间提交了 247 次。
这不是哪个刷题网站的排行榜,是一个 AI Agent 在一道引力波数据的题上,自己泡了整整 12 个小时爬出来的曲线。跑这道题的是 GPT-5.5,没人在旁边喂它答案,它就靠一次次交卷、看分、改、再交,硬生生把自己从及格线以下拽到了七十分。
我看到这个数字的时候,脑子里冒出来的第一反应不是「厉害了」,而是一个有点凉的念头,我们过去衡量模型的方式,可能一直在问错问题。
字节 Seed 前两天发了个东西,叫 EdgeBench,一个专门用来衡量「真实世界环境学习」的超长程评测集。听着有点绕,我一开始也没太当回事,AI 圈每天都在发 benchmark,跟便利店上新似的。但翻完他们那篇博客我坐直了一下,因为它测的不是模型脑子里已经装了多少东西,而是另一件事,把模型扔进一个真实环境里,给它足够长的时间、足够多的反馈,它到底能不能越干越强。
项目主页在这 https://seed.bytedance.com/edgebench ,论文 https://edge-bench.org/paper.pdf ,代码和数据也都开了,https://github.com/ByteDance-Seed/EdgeBench 和 https://huggingface.co/datasets/ByteDance-Seed/EdgeBench 。想自己上手扒的可以直接去。
我想跟你唠唠这里面几个让我坐不住的点。
先说清楚这个 benchmark 到底新在哪。
你去看现在市面上绝大多数评测集,SWE-bench、MMLU、GPQA 这些,它们测的都是一个东西,模型现在会不会。给你一道题,你答,答对得分,答错扣分,一锤子买卖。这套逻辑没错,它衡量的是模型训练完之后固化下来的那身本事。
但真实世界不是这么运转的。
我平时的工作,很大一部分就是给大模型搭那层让它能真正干活的工程脚手架,agent 的工具链、超时看门狗、失败重试、上下文怎么塞,这些乱七八糟的东西(这行有个黑话叫 harness,你就理解成给模型搭的脚手架就行)。搭得多了我有个特别深的体感,模型在真实任务里的表现,跟它在静态评测里的分数,经常是两码事。
为啥?因为真实工作里那些关键的东西,压根不在训练语料里。你要跑通一个陌生的代码库,得反复试错,读报错,猜它想要啥,改一版再试。环境本身还一直在变,新工具、新接口、新坑,昨天的经验今天就过期了。任何一份训练数据都不可能提前把这些全覆盖了。
所以真正决定 Agent 值不值钱的,慢慢从「它一开始会多少」,变成了「它进到环境里之后,学得有多快」。
EdgeBench 就是冲着这个来的。它设计了 134 个任务,横跨六大领域,科学、复杂软件工程、白领知识工作、算法优化、前沿数学,还有数字游戏。超过 90% 是全新造的题,不是从网上扒的现成题库,避免了模型早就在训练里见过的尴尬。
最狠的是任务的时长。每道题都支持 Agent 连续干 12 个小时以上,有些延长实验甚至跑了 72 小时。
这个 12 小时是什么概念,我得给你一个锚点。他们记录了人类专家完成单道题需要的时间,平均 57.2 小时,最长的一道要 320 个小时。320 小时啊兄弟,一个人一天干 8 小时也得干 40 天。这不是那种做个选择题、写段代码就完事的活,是货真价实、需要人泡进去反复搞的硬骨头。
把 Agent 扔进这种题里,你测的就不再是它的记忆力,而是它的学习力。
然后就到了让我最上头的部分,他们真的从这堆数据里,找出了一条 Scaling Law。
我先解释一下 Scaling Law 是啥,怕有朋友不熟。过去几年 AI 圈之所以敢往里砸这么多钱,靠的就是预训练 Scaling Law 这么个东西,它说的是模型能力会随着数据量和算力的增加,以一种相当可预测的方式往上涨。你投多少料,大概能出多少活,有个规律可循。这就是为什么大厂敢一轮一轮地烧钱堆算力,因为曲线在那儿摆着,心里有底。
但那条规律讲的是训练阶段的事。模型训好了、进到真实环境里之后,还有没有类似的规律?这一直是个空白。
EdgeBench 给了个答案。
他们让每个模型在全部 134 道题上,每题独立跑 3 次,一个模型就是 402 条学习曲线。你单看其中任何一条,那叫一个乱,分数上蹿下跳,充满噪声,跟心电图似的看不出个所以然。Agent 在一道题里的真实过程就是这样,磕磕绊绊,走两步退一步。
可当他们把这 402 条曲线按交互时间对齐、平均之后,好家伙,那堆乱七八糟的噪声,收敛成了一条极其干净的曲线。
一条 log-sigmoid 曲线。平均拟合精度 R² 达到 0.998。

我盯着这个 0.998 看了好一会儿。搞过数据的都知道,R² 是衡量拟合好坏的指标,1 是完美,现实里的数据能上 0.9 就该谢天谢地了,0.998 这种精度,几乎是在说「这背后有条铁一样的规律」。混沌的个体行为,一平均,露出了底下工整得吓人的结构。
而且这不是纯凑出来的经验公式。他们说这条曲线还能从图探索(graph exploration,可以粗略理解成在一张巨大的可能性地图上找路)理论的角度解释得通。也就是说,它不只是「碰巧长这样」,是有底层道理撑着的。
聊到这我得停一下,说个我自己的感受。
这事儿最触动我的地方,其实不是那条曲线本身,而是它揭示的一个画面,Agent 在真实环境里,是会成长的。它不是一个交完卷就定型的考生,而更像一个进了新项目组的实习生,一开始磕磕绊绊,但只要你给它时间和反馈,它真的会一点点摸清门道,越干越顺。
前面那个引力波的例子就是活的证据。GPT-5.5 那 12 小时里,分数的几次关键跃升,不是靠它闷头把参数调得更细,而是靠它想明白了一件事,重新定义问题。论文里那个过程我觉得特别精彩,Agent 先想办法让任务变得可衡量,再去拆解自己到底败在哪,定位到瓶颈,然后把已经能用的核心保住,只去修补剩下那点错。
这套路数,说实话,跟一个靠谱的工程师排查线上问题的思路,一模一样。先让问题可观测,再二分定位,护住 working 的部分,小步快跑地改。我看到这段的时候是真有点恍惚,这已经不太像在描述一个模型的行为,倒像在描述一个人的工作方法了。
不同的 Agent 学习的姿势还不一样。他们观察到大概三种,有的稳步往上爬,有的前期猛冲一段然后进平台期卡住,还有的会在长时间的停滞之后,突然来一下突破。
你把「Agent」这个词换成「新来的同事」,这几句话是不是毫无违和感?有的人上手快,有的人闷头憋大招,有的人前面一直不开窍你都快对他失望了,结果某天突然通了。
我一直觉得,AI 这波最迷人的地方,从来不是它多能算,而是它身上开始长出这些原本以为是人类专属的东西。
然后是第二个让我坐不住的发现,学习速度,在变快。
光知道 Agent 会学习还不够,字节这帮人又追问了一句,那不同代际的模型,学习的速度会不会变?新模型是不是不光起点更高,连「进环境之后学得多快」这件事也在进化?
这个问题设计起来有个坑。你直接拿新模型和老模型比进步幅度,比不公平,因为新模型本身底子就厚,起点高,你分不清它涨得快是因为真会学,还是因为它一开始就懂得多。
他们的处理挺巧。挑了 18 道所有模型初始表现都差不多的题,把起跑线拉平,然后拿 2025 年 9 月到 2026 年 5 月这段时间里陆续发布的好几代模型,每个都跑 2 小时,看这 2 小时里各自能涨多少。涨得多的,就是学得快的。
结果是,越新的模型,学得越快。而且对当时最顶尖的那批模型来说,这个学习速度,接近每三个月翻一倍。
每三个月翻一倍。
我把这句话反复读了几遍。如果这条趋势是真的、能持续,那它描述的其实是一件挺吓人的事,模型之间的差距,未来可能不主要体现在「谁一开始更聪明」,而体现在「谁进了环境之后学得更快」。起点的优势会被时间摊平,但学习速度的差距会随时间越拉越大。
这就有点像两个人跑步,一个起跑领先,但另一个加速度更大。短期看不出什么,时间一长,加速度大的那个会把领先的甩得看不见影。

坦率讲,作为一个天天跟这些 agent 打交道、给它们搭台子的人,我对这个结论是既兴奋又有点复杂的。
兴奋是因为,照这个说法,我们手里这些工具的天花板,可能比想象的高得多。你现在觉得某个 Agent 干活笨手笨脚,那可能只是因为你没给它足够的时间和反馈让它学。它不是不行,是还没学完。
复杂是因为,那个关于「AI 会不会取代人」的老问题,在这个视角下又有了新的分量。我们过去安慰自己的说法通常是,AI 只会它训练过的东西,遇到没见过的新情况就抓瞎。但 EdgeBench 想说的恰恰是,AI 正在长出面对新环境、从零开始摸索学习的能力,而且这个能力还在加速。
我不打算在这儿贩卖焦虑,那玩意儿廉价。我更愿意把它看成一个信号,一个提醒我们该重新校准预期的信号。
说回这个 benchmark 本身,我特别欣赏它的一点是那份克制的诚实。
现在 AI 圈太多东西是拿来炒的,一个模型出来,各种自制的、说不清怎么测的分数漫天飞,什么「超越人类」「遥遥领先」,看多了人是会麻的。EdgeBench 反过来,它做的是一件苦活累活,造真实的题,让 Agent 泡足够长的时间,老老实实记录约 38000 小时的环境交互数据,然后从里面抠出规律。
38000 小时是个什么量级,你换算一下,差不多是四年多。他们把相当于一个 Agent 不吃不睡跑四年的数据量,压缩进了这一套评测里。这种下笨功夫的东西,我天然更信一点。
而且他们把其中 51 道题和完整的评测框架都开源了。这点我要单独夸一句,棒棒的。开源意味着别人能复现、能质疑、能在上面接着搞,而不是发个博客甩几张漂亮曲线图就完事。想动手的朋友,代码在 https://github.com/ByteDance-Seed/EdgeBench ,数据集在 https://huggingface.co/datasets/ByteDance-Seed/EdgeBench ,论文里那些拟合的细节 https://edge-bench.org/paper.pdf 讲得比我这儿清楚多了。
我自己最想拿它去验证的是一件事。我平时搭 harness 的时候,一个特别头疼的问题是,到底该给 Agent 多长的运行预算?超时看门狗设多久合适?设短了它还没摸到门道就被我掐了,设长了纯烧 token。EdgeBench 这条 log-sigmoid 曲线如果靠谱,它其实给了一个可以量化的参考,你能大致知道在哪个时间点,Agent 的边际收益开始变得不划算了。这对我们这种天天要算 token 预算的人来说,不是玄学,是能直接落到工程决策上的东西。
当然我也得泼盆冷水,别看完就上头。
这套评测再真实,它终究是评测。真实世界比 134 道题野得多、脏得多,充满了没有明确评分器、连目标都模糊不清的活儿。EdgeBench 里的 Agent 至少还有个反馈信号能让它知道自己是往好了走还是往坏了走,现实里很多任务,你连自己做得对不对都不知道,哪来的反馈去学。所以「学习速度每三个月翻一倍」这个结论,成立的前提是那个能给出干净反馈的环境。把这个前提去掉,故事会复杂很多。
我说这些不是要给它挑刺,恰恰相反,我觉得正是因为它把话说得这么严谨、把边界划得这么清楚,这个工作才靠得住。真诚地承认自己测了什么、没测什么,比吹得天花乱坠可信一万倍。
写到这儿,我想起万能青年旅店那句,是谁来自山川湖海,却囿于昼夜厨房与爱。
以前我们总觉得,模型是被囿住的那个,囿在训练数据的那口井里,井有多深,它就有多大本事,一步都迈不出去。EdgeBench 让我有点动摇了。它让我看到,这些模型好像正在学着从井里探出头,去看看外面那片一直在变的山川湖海,然后一点一点,学会在里面游泳。
它现在游得还笨,一道题要泡 12 个小时,还得靠人给它造好的泳池、清晰的水线。但学习速度每三个月翻一倍这条曲线,指的是它学会游泳的速度,本身也在变快。
我不知道这条曲线能延伸到多远,也没人知道,可能到某个点就撞墙平掉了,log-sigmoid 后半段本来就是要饱和的。但至少此刻,看着那条从 42.8 一路爬到 67.0 的线,看着那 402 条噪声平均出来的干净弧度,我心里那个做工程的部分是踏实的,我们手里这套东西,还远没到顶。
有点子牛逼,说真的。
至于该兴奋还是该睡不着觉,我也没想明白。可能都得有一点吧。反正我打算这周末把那 51 道开源的题拉下来,自己上手泡一泡,看看它在我的脚手架上到底能爬到几分。有结果了再回来跟你唠。