AI 中心的数据黑洞:模型越大,反而越笨拙地学习
周末下午翻 Dwarkesh Patel 的博客,刷到一句话,我盯着看了好一会儿。
他说,我们把现在这些 AI 看成一片闪着光的星系,满天都是能力的星座,可在这片星系的正中心,肉眼根本看不见、却把所有星座维系在一起的,是一个大到无法想象的数据黑洞。
我承认,这个比喻有点子文艺,但它不是来虚的。它戳的是一个我天天在工位上能摸到、却很少有人正面去聊的事实,这玩意一旦看清楚,你再看 GPT、看 Claude、看那些营销稿里「越来越聪明」的模型,感觉会完全不一样。
原文在这 https://www.dwarkesh.com/p/the-sample-efficiency-black-hole-2 ,标题就叫 The data black hole at the center of AI。我看完想跟你唠唠,因为它把一件我一直隐约觉得不对劲、但说不清的事,给说清楚了。
先抛结论,免得你嫌我铺垫长。
这几年模型变强,主要不是因为它们「学得更聪明了」,而是因为我们喂给它的数据,越来越多、越来越好、越来越贵。它的学习效率本身,可能压根没怎么进步。
说真的,这话第一遍听有点反常识。
先说一个词,样本效率
智能有很多种定义,Dwarkesh 挑了一个我觉得特别工程师的角度,叫样本效率(sample efficiency,意思是你想在某个领域里干得利索、干得专业,到底得看多少数据)。
一个小孩,听大人讲几次「这是猫那是狗」,他就会了。下回看见一只他从没见过的、橘色的、胖的、缺只耳朵的猫,他照样认得出来。他不需要你给他看一千万张猫片。
这就是样本效率高。
现在的大模型呢?它认猫的本事,是吞了整个互联网换来的。
Dwarkesh 的判断是,过去这几年,我们在「训练样本效率」这件事上其实没怎么往前走。模型变强,靠的是另一条路,把数据的分布大幅拓宽、拓深,再砸算力去生产这些数据。Epoch 有篇文章专门讲这事,标题就很直白,说数据是 AI 进展里最被低估的那个驱动力 https://epoch.ai/gradient-updates/the-least-understood-driver-of-ai-progress 。
你可能会问,那 RL 呢,强化学习不是这两年最火的那套吗,让模型自己琢磨自己进步的那套。
对,RL 是主角。但 Dwarkesh 把它扒开了给你看,它本质就是一种合成数据生成。
我用大白话讲一下这套是怎么转的。你拿一大堆算力,让模型对着一个 verifier(验证器,就是个能判对错的裁判,比如一道数学题有标准答案、一段代码能不能跑通)反复试,试出一堆答案,把对的那些挑出来。然后你拿这些「挑出来的好答案」去训练模型,让它学会预测这些正确的解题过程。
这跟训练它去预测「互联网文本里下一个词是啥」,是一码事。换汤不换药,都是喂数据让它背。
听着挺自动化对吧,好像模型在自己跟自己玩。但这里有个前提,藏得很深。
模型得先「蒙对一点点」,这套才转得起来
RL 想转起来,模型必须对正确答案先有那么一丁点先验概率,也就是说它得能「蒙到边」,你才有得挑。要是它一万次尝试里一次都蒙不对,那你算力砸再多也挑不出好数据,锅里根本没米。
那这个「蒙到边」的底子哪来的?
靠人。靠海量的、专家级的人类示范。
Dwarkesh 这里写得有点让我后背发凉。他说,你想让模型在哪个领域、哪个技能上能干活,你就得在那个领域里塞进多到「让大脑发胀」的人类专家轨迹。而且这些数据有多定制、多专属,怎么强调都不过分。
不信你去看招聘。
他点了名,让你去 Mercor https://work.mercor.com/explore 上翻翻那些岗位。我顺手翻了一下,好家伙。
有专门招「Word 专家」的,活儿是把那些老掉牙的旧文档,转成排版精美的 Word 文件。有招法律专家的,让你写出以假乱真的并购尽职调查、证券申报文件。有招管理咨询顾问的,让你照着模板写市场调研报告。几十种细分工种,一种比一种具体。
这些人不是在「干活」,他们是在给模型当老师,一笔一画地示范「这活儿专业的人是怎么做的」。
而且不只是要专,还要多。
Dwarkesh 说,每一个技能背后,至少对应着几百个人类专家,在那儿生成示范答案、写评分标准、解释他们脑子里那条思维链是怎么走的。这就是为什么那个给模型做标注、搭训练环境的数据产业,一年能挣几十亿美元,而且很快就是几百亿。
我看到这儿停下来想了想。
他打了个比方,特别扎心。想象一下,假如你这辈子想学会「润色一个 Word 文件」这么个事,得花上几十年,几百个教授同时给你上课,再做上百万道练习题。
你受得了吗。
更要命的是,连「任务数」这个差距都还低估了真实情况。模型练每道题,比人练得狠太多了。人类学生做一道课本题,练一两遍也就过了。而 GRPO(一种主流 RL 算法)会让模型针对同一道题,生成几百上千条解答。
Dwarkesh 用了个词,说我们在缝一个弗兰肯斯坦的怪物,身上缝着十亿块精心构造的样本,一块一块拼起来。
我读到这句的时候,脑子里浮现的是我平时盯的那些训练任务,一行行的日志哗哗往下滚,背后是不知道多少人写了多少示范喂进去的。这个画面,确实有点子科幻。
一个旁证,开源为什么总能几个月就追上
Dwarkesh 这里插了一个我觉得特别有说服力的旁证。
Epoch 最近报告说,开源模型只落后闭源的 SOTA(state of the art,业界最强水平)大概 4 个月 https://epoch.ai/data-insights/open-closed-eci-gap 。
你有没有想过,为什么开源、为什么那些一度落后的玩家,总能在几个月内就追到第一梯队屁股后面?
Dwarkesh 的解释是,因为真正驱动进展的是数据,而数据这东西,可以从公开 API 里轻松蒸馏出来(distill,简单说就是让小模型去模仿大模型的输出,把它的本事偷学过来)。
反过来,那些超参数、训练的小技巧、架构上的微优化,是蒸馏不走的。
所以你看,如果进展真的主要靠那些藏着掖着的训练技巧,那追赶应该非常难才对,难到我们不可能观察到「4 个月就追上」这种事。现实是大家追得很快,这本身就说明了,门道不在技巧,在数据。
这个推理我特别喜欢。它不是拍脑袋下判断,是从一个公开现象倒推回去,逻辑闭得很死。
我们老觉得这些大厂的护城河是什么独门绝技,其实护城河可能就是那个看不见的数据黑洞,又深又贵,但只要你愿意花钱花算力,谁都能往里填。
中场,把人和 AI 摆一块儿比一比
聊到这,Dwarkesh 干了件特别解气的事,他直接把人和 AI 的样本效率,摆桌上对着量。这几个数字,我建议你记一下,下次有人跟你吹 AI 马上要超越人类,你可以拿出来。
第一个,文本。
一个人,平均每小时听到、看到大约 2000 个词。从出生到长大成人,满打满算,他接触到的语言大概是 2 亿个 token(token 是模型处理文本的基本单位,一个英文词差不多一两个 token)。
前沿大模型训练用多少?几十万亿到几百万亿 token。
差了将近一百万倍。
你没看错,一百万倍。一个人用 2 亿就长成了通用智能,模型得用几百万亿。
第二个,机器人。
一个人,几个小时就能学会遥控操作一个随便什么型号的人形机器人或者机械臂。可机器人行业为什么到现在还没变成几十万亿美元的产业,没有一支 Unitree G1 大军在满世界干活?就是因为 AI 学得比人低效太多了。我们已经收集了几百万小时的示范,还是不够让它们去干那些复杂的、开放性的活儿。
第三个,开车。
一个青少年,大概 20 小时练习就能学会开车。哪怕你把他这 16 年攒下来的物理直觉全算成训练数据,也比 Waymo 和 Tesla 训练自动驾驶所需要的数据,少了至少三到四个数量级。
三个领域,文本、身体、驾驶,全是同一个故事。人少得离谱,机器多得离谱。
你能想到的反驳,他都堵上了
我读到这种对比,第一反应是想抬杠。这比较不公平啊。我估计你也是。Dwarkesh 知道你会抬杠,他把几个最常见的反驳,挨个堵了一遍,堵得还挺漂亮。
第一个杠,进化论。
你会说,人凭啥只算这一辈子看的数据?我们背后是几十亿年的进化啊,那才是人类真正的「预训练」,拿一个一辈子的数据量去比模型从零冷启动,耍赖。
Dwarkesh 的回应是,人类基因组才 3GB,其中只有百分之一二是编码蛋白质的。这点空间,根本存不下那种 TB 级别的模型参数(前沿模型动辄好几个 TB)。
所以进化大概率不是在「存参数」。更可能是进化找到了对的超参数和损失函数,至于相当于「参数训练」的那部分,还是在你这一辈子里、编码在你大脑那张神经连接图里慢慢长出来的。他还提到跟 Adam Marblestone 那期播客 https://www.dwarkesh.com/p/adam-marblestone ,里头聊到,损失函数可能才是进化更重要的那个发现。
而且就算退一万步,你硬说预训练那几万亿 token 是在补进化的课,那也解释不了「边际能力」为啥还那么费数据。一个受过教育的人,再学一门新编程语言,不需要 100 个教授轮流教你。可模型,哪怕已经预训练完了,它还是需要。
这一刀补得很准。
第二个杠,多模态。
你会说,你只算了文本啊,我们一辈子看的、听的、摸的那些感官信息呢?算上这些,从生到死怎么也有几百亿到几千亿 token 了。
Dwarkesh 说,行,那你怎么解释盲人和聋人。
那些被切断了某种感官的人,可能确实少了某项能力,但他们的通用智能,跟所有人没两样。这就说明,那几十亿个感官 token,根本不是让人变聪明的那个关键。
他还补了一句,那些只能靠手语和阅读来沟通的聋人,摄入的语言 token 比我们前面算的 2 亿还少得多,可这点量,已经足够把他们撑成一个完全的通用智能体了。
= = 我看到这句是真的服了。
第三个杠,scaling law(缩放定律,就是那条「模型越大数据越多就越强」的经验规律)。
懂行的会说,缩放定律不是讲了吗,模型越大,样本效率越高。人脑有 100 万亿个突触,前沿模型现在大概 5 万亿参数,那我再把模型放大一两个数量级,是不是就能追上人的样本效率了?
这个杠最硬,Dwarkesh 算给你看。
按 Chinchilla 那篇缩放定律论文里的常数来算(换别的常数,结论的性质也不变),缩放定律的公式里,参数那一项和数据那一项,是各自独立加到损失里的。这是个啥概念,你哪怕把参数加到无穷大,所能换来的、对数据需求的降低,也就大概十倍。
而人,比这些模型的样本效率高了几千倍到几百万倍。
十倍,对几千到几百万倍。
靠堆参数,根本补不上这个窟窿。Dwarkesh 下了个挺重的判断,他说这真的说明,人类压根就在另一条完全不同的缩放曲线上。
不是同一条曲线上你追我赶,是两条曲线。
那问题来了,样本效率低,要紧吗
聊到这你可能有点丧。照这么说 AI 不就没戏了吗。
别急,Dwarkesh 自己也转了个弯,这也是我觉得他清醒的地方,他没有顺着自己的论点一路唱衰。
他问,样本效率低,到底要不要紧?
那些大实验室,OpenAI、Anthropic 们,说到底就两个目标,一是把白领的活儿自动化掉,二是把 AI 研究本身自动化掉。这两件事,真的需要人类级的样本效率才能干成吗?
先说白领工作。
这里的赌注是,一个软件工程师、分析师、会计师,日常干的那些「常见任务」,它就是常见的。既然常见,你就能靠 RL 和 SFT(监督微调)相对轻松地把它拉进模型的数据分布里。Anthropic 那条一路向上的营收曲线 https://www.anthropic.com/news/series-h ,本身就说明了,光是把任务拉进分布,哪怕不复制人类的样本效率,也能挖出巨大的价值。
Dwarkesh 这段我特别认同,他算了一笔我们工程师听得懂的账。
是的,训练 AI 去干这些活儿,比训练一个人低效太多了。但那又怎样?
人的寿命撑不起模型这种训练量和广度。打个比方,假如你这人得了种怪病,非得把 GitHub 上每一个公开仓库都读完,才能当个合格的开发者。那训练你就毫无意义,你还没毕业就该领养老金了,而且就算练成了,你一次也只能干一个项目。
可 AI 不一样。它能用几个吉瓦的电,像消防水管喷水一样,一下子灌进去。更关键的是,它学到的本事,可以摊薄到几十亿次会话上去。
所以你训练它的时候哪怕低效到离谱,最后这笔账还是巨赚。
这个视角一下把我说服了。我们老盯着「效率」这个词,可在 AI 这儿,效率低不等于不划算,因为它的产出可以无限复制,分母大到夸张。
真正难啃的,是那些「分布外」的活儿
当然 Dwarkesh 没把话说满。
他说,关键得看一份工作里,有多少是「分布外」(out-of-distribution)的思考,就是那种你没法提前训练、它每天都在面对离数据分布很远的新问题的部分。
有些工作机械、可预测,AI 时代之前就被自动化了,比如银行柜员、旅行社。这些没啥分布外的东西。
可有些工作,天天都在跟离分布很远的问题打交道。软件工程,恰恰就是这种。
写到这我得插一句自己的感受。我平时干的活,往大了说就是给大模型搭那层让它真能干活的工程脚手架,调度、工具链、上下文、各种超时和重试。这活儿最磨人的地方,恰恰就是那些「分布外」的瞬间,某个模型在某个边界条件下突然抽风,某条工具调用链在第七步莫名其妙断了,日志里啥都看不出来。这些东西,没有哪个数据集提前教过你,你只能现场顺藤摸瓜。
所以 Dwarkesh 下面这个判断,我举双手赞成。
他说他愿意打个赌,2028 年市场上对人类软件工程师的总需求,会比现在还高,主要就是因为 AI 是一种「互补输入」。
不是替代,是互补。这话听着可能不太顺耳,尤其在天天有人喊「程序员要失业」的当下。但我是真的觉得他说的是事实,至少在「分布外」这块没被攻克之前,人还得在。
那这块硬骨头,实验室打算怎么啃?
他们的计划是,先把 AI 研究自动化掉,然后让这些自动化的 AI 研究员,去把样本效率这个难题给解了。
于是问题绕了一圈,又回到了原点,变成了一个特别拧巴的问题,一群本身就不具备人类级样本效率的 AI,能不能反过来,去解掉那个通往人类式智能与学习的、剩下的研究难题?
这是一个先有鸡还是先有蛋的循环。
Dwarkesh 说这个他留到下一篇写,但他顺手吐槽了一句现在大家聊「智能爆炸」的姿势,我觉得吐得挺好。他说现在人们想这事儿太粗糙了,要么干脆否认 AI 能加速 AI 进展,要么就直接假设「上帝从另一头蹦出来」,中间那段,从 LLM 起步、到底会怎样飞快往前的过程,没人愿意认真推演。
中间那段,恰恰是我们这些搭脚手架的人,每天泡在里面的地方。
写在最后
合上这篇文章,我脑子里一直转着那个黑洞的比喻。
我们这个行业特别擅长造神。每出一个新模型,发布会上灯光一打,benchmark 分数往上一甩,好像它真的「觉醒」了,真的「理解」了世界。可 Dwarkesh 把灯关掉,让你看见星系正中心那个又黑又重的东西,那不是什么神秘的智能火花,那是人类用几十亿美元、几百万小时专家劳动、几百万亿 token 一点点喂出来的、沉甸甸的数据。
它确实造出了一片璀璨的星空。这点我从不否认,我天天靠这片星空吃饭。
但你得知道那束光是从哪来的。
知道了,你再看那些「AI 马上就要有自我意识」的标题,大概也能像我一样,笑一下,然后划走。它没那么玄,也没那么轻。它就是个又笨又贵、但被我们用钞票和算力硬生生喂大的孩子。
是谁来自山川湖海,却囿于昼夜厨房与爱。我们造的这个东西,来自整个互联网的星辰大海,却也囿于那个谁也填不满的数据黑洞里。
挺浪漫的,也挺沉的。
晚安。