Anthropic 拆了 40 万次 Claude Code 会话:越懂行的人,越能从 AI 身上榨出价值

小岛AI 2026 / 06 / 17

昨天 Anthropic 扔出来一份研究,我看完标题先愣了一下。

标题叫《Agentic coding and persistent returns to expertise》,翻成人话大概是「智能体编码,以及专业知识为什么还在持续给你回报」。他们干了一件挺笨重也挺扎实的事,把约 40 万次 Claude Code 的真实会话翻出来,分析了整整 7 个月,从 2025 年 10 月一直看到 2026 年 4 月,背后是约 23.5 万个真人。

我做的工作天天跟这些东西打交道,给大模型搭那层让它真正能干活的工程脚手架,所以这种「不靠想象、直接扒生产数据」的报告,对我胃口。它没有去预测什么星辰大海,就是低着头数数,数出来一个我觉得这两年所有用 AI 写代码的人都该知道的结论。

我先把这个结论一句话讲了,你再决定要不要往下看。

人决定做什么,AI 决定怎么做。而你对自己那一行越懂,AI 每条指令能替你干的活就越多、越容易成。会不会写代码,反而是次要的。

听着像句正确的废话对吧。但这次它后面是有数字撑着的,而且数字比我预想的要锋利。

先说那条最干净的分界线

Anthropic 用一个叫 Clio 的隐私保护分析工具去读这些会话,不碰你具体写了啥,只看结构和决策归属。他们把一次会话里所有有意义的决定拆成两堆,一堆叫规划(做什么、走哪条路、什么算干完了),一堆叫执行(改哪个文件、写什么代码、用什么语言、跑什么命令)。然后挨个判断,这个决定是人做的,还是 Claude 做的。

数出来的结果干净得有点漂亮。

平均下来,人做了大概 70% 的规划决策,但只做了 20% 的执行决策。反过来说,Claude 接手了八成的「怎么干」。

你品一下这个分工。它不是「AI 帮你打打下手」,也不是「AI 要把你取代了」,是一条挺清楚的线,人站在「要去哪」这边,机器站在「怎么走过去」这边。我自己平时用 Claude Code 的体感跟这条线几乎严丝合缝,我基本不太管它具体怎么改文件、先读哪个再读哪个,我管的是这事到底该不该这么做、做到什么程度收手。

还有个细节我挺喜欢。一次典型会话大概是 4 个来回,你发一条提示,Claude 平均会甩出去约 10 个动作(读文件、改代码、跑命令),多的时候一条指令引爆 100 多个动作,每个来回平均还给你写 2400 词的输出。好家伙,这哪是助手,这是你说一句它干一串。

而且有意思的是,你攥得越紧它越缩手。当用户把执行权牢牢握在手里(执行决策占到八成以上),Claude 每回合就老老实实只动 8 下;一旦你把规划也甩给它(让它做八成以上的规划),它每回合能干到 16 下。它会读你的姿态,你给多大空间它走多远。

然后是这次真正的主角,「专业度」

这份报告最戳我的,不是上面那条分工线,是它对「专业度」的定义。

它不是看你职位,不是看你简历上写了几年经验。它是任务特定的。报告里 Claude 会给用户在这一个具体任务上的专业度打分,五档,从新手到专家,看三个信号,你把要求说得多准、你让它去验证什么、是你在纠正它还是它在纠正你。

它举了两个例子,我看完直接服了。

一个资深工程师,第一次问 Rust 的问题。在 Rust 这件事上,他就是新手。简历再厚也没用。

一个会计,从没碰过 Python。但他能准确告诉 Claude,这个对账脚本必须执行哪几条规则,还能在月末结账的时候,一眼抓出脚本漏掉的那个边界情况。在这个任务上,他就是专家。

你看出来了吗,专业度在这里跟「会不会编程」彻底脱钩了。它衡量的是你对你要解决的那个问题,到底懂到什么份上。那个会计不懂 Python 的语法,但他懂对账,他知道哪里会出错、什么叫做对了。这份「知道」,才是真正稀缺的东西。

我盯着这两个例子看了挺久。因为它把一个我一直模模糊糊感觉到、但没说清楚的事给点破了。这两年我看太多人焦虑「我不会写代码会不会被淘汰」,又看太多人觉得「我会写代码所以我安全」。这报告等于把这两种人都拍了一下,你们关注错地方了。

越懂行,AI 替你干得越多

光定义还不够,它拿数据把这条线焊死了。

新手的会话长啥样,你发一条提示,平均触发 Claude 大概 5 个动作,写 600 词左右。

专家的会话呢,同样一条提示,动作链长一倍多,12 个动作,输出是 5 倍,3200 词。

同样一句话扔进去,专家能让 AI 多干好几倍的活。而且这个差距,在每一类工作、每一档任务里都稳定存在。他们还做了回归,把工作类型、任务价值、月份、职业、模型都控制住之后,专业度每往上升一档,动作还能多 9%、输出多 13%,统计上铁稳(p 小于 0.001)。

这事儿想想是顺的。专家的指令本身信息密度就高,他一句话里藏着一堆隐含的约束和判断,AI 接到这种高质量的输入,自然能放开手脚跑远一点。新手给的指令含糊,AI 不敢造次,每步都得回来确认,跑两下就缩回来了。

我有时候带人用 Claude Code,最直观的感受就是这个。会的人发一句话能让它跑出一整个 feature,不会的人发一句话,俩人对着屏幕大眼瞪小眼,它不知道你要啥,你不知道它能干啥。工具是同一个工具,差的全在那条提示词背后,你脑子里有没有货。

成不成,看你带了什么进来

接着是成功率,这部分我觉得最值得做产品和管团队的人抄下来。

怎么算成功,他们抠得很细,因为看不到你真实世界的结果,只能从记录里找硬证据,匹配的 git commit 和 PR、测试套件跑过了、你自己明确说「行了就这样」。够严的那档叫 verified success,验证成功,得既判定成了、又有至少一个硬信号。

然后差距出来了。

新手的会话,验证成功只有 15%,连「至少部分成功」也才 77%。

中级往上,验证成功一下跳到 28% 到 33%,部分成功到 91% 到 92%。

最狠的是遇到麻烦之后那一段。所谓遇到麻烦,就是会话里出现了实打实的翻车信号,报错、测试挂了、反复重试、用户开始表达不满。在这种已经开始翻车的会话里,新手最后能验证成功的只有 4%,专家是 15%。差了快四倍。

还有一个数字我看完沉默了一下。「放弃率」,就是判定失败、而且一行代码都没写出来、直接撂挑子。新手会话里 19% 是这么结束的,其他所有人只有 5% 到 7%。

最没经验的那批人,一卡住就更容易直接走人。报告里有句话说得挺准,专业度的一部分价值,就是你卡住的时候,还有本事把 AI 往对的方向上掰回来。新手卡住了,他不知道是 AI 错了还是自己错了,更不知道往哪掰,于是关掉窗口,这事就黄了。

我太懂这个瞬间了。所有跟 AI 协作的人都撞过这堵墙,它给你一个看起来对、跑起来错的东西,这时候你能不能稳住、知道下一句该怎么问,几乎决定了这一整次会话是出活还是白忙。

你是干哪行的,没你想的那么重要

报告里还有一刀,砍向了「职业」。

他们把会话推断出职业,对到美国劳工统计局的 23 个职业大类上。约七成会话能推断出职业。然后看在产出了代码的会话里,不同职业的成功率差多少。

软件相关职业,验证成功大概 34%;其他所有职业,29%。用宽松点的「部分成功」看,一个 89%,一个 88%,就差一个点。

数据集里十大职业,每一个的成功率,都落在软件工程师的 7 个百分点以内。

我再说一遍,律师、会计、做管理的、搞设计的、跑销售的,这些人指挥 AI 写代码的成功率,跟专业程序员差距在 7 个点以内。增长最快的几个非软件职业,是管理、销售、法律。厉害了,更损的是,管理岗的验证成功率居然还略高于软件工程师,报告猜可能是管理那套「把事情讲清楚、把人指挥明白」的本事,迁移到指挥 AI 上特别好使。

这一刀挺疼的,但我觉得它砍得对。编码背景这道墙,正在被 AI 一点点拆平。你是不是科班、会不会手写一个红黑树,跟你能不能用 AI 干成一件技术活,关系越来越小了。门口那个保安越来越松,谁都能进来试试。

但别急着松气。墙拆了,地基没拆。那个地基就是上面说的领域专业度。门是敞开了,可进来之后能不能把活干成,还是看你对你要解决的问题懂多少。

7 个月里,工作本身也在变样

顺带说一组我觉得特别能说明趋势的数字。

这 7 个月里,花在修复坏代码(fixing)上的会话占比,从 33% 掉到了 19%。调试这件事的占比,几乎腰斩。

省下来的力气去哪了。运行软件(部署、配置、监控这些)从 14% 涨到 21%,写作和数据分析差不多翻倍,从约 10% 涨到 20%。大家在往更端到端的用法迁移,不再是「帮我 debug 这一行」,而是「把这套东西部署起来跑」「帮我把这堆数据分析了」「帮我把这份文档写了」。

更值钱了也是真的。他们拿自由职业市场的报价去估每次会话的经济价值,7 个月平均涨了约 27%,新建类任务涨了约 43%。注意这价格估得粗,只能用来互相比、不能当真金白银读,但趋势是清楚的,AI 在接越来越重、越来越值钱的活。

调试占比腰斩这件事,我私心觉得是整份报告里最被低估的一个信号。因为这两年模型最大的进步,可能不在于它能写多惊艳的代码,而在于它写出来的东西越来越不用你回去擦屁股了。脏活变少,你才腾得出手去干那些更靠上游、更需要判断力的事。

那这对我们普通人意味着什么

我把这份报告的几条线在脑子里捋了一遍,捋出来一个挺反常识、但越想越觉得在理的画面。

过去我们默认,技术活的门槛是「会不会做」,是手艺。现在这道门槛在塌,AI 把执行那一层的手艺给平价化了,几乎谁都能调用。于是稀缺性整个往上游挪了一格,挪到了「知不知道该做什么、做到什么算对」这一层。

这层东西,报告里叫专业度,我更愿意叫它「判断力」。它是那个会计知道对账规则会在哪里出错,是那个资深工程师在自己熟的领域里一眼看出 AI 跑偏了,是你卡住的时候知道下一句该怎么问。它编不出来,也抄不来,得是你真在那个领域里趟过、栽过、想明白过,才长得出来。

还有一个特别温柔的细节,我得单独拎出来说。报告发现,大部分增益来自从新手迈到「中级」,从中级再到专家,曲线就平缓了。也就是说,你不需要成为某个领域的绝世高手才能从 AI 这儿拿到好处,你只要对它「够懂」、能干活就行,剩下的深度专精只是锦上添花。

这对绝大多数人是个好消息。它没要求你成神,只要求你在某一件事上,是个认真的、靠谱的、知道好坏标准的人。

我一直觉得这两年 AI 这股浪里,最容易让人慌的,是那种「努力好像不值钱了」的失重感。这报告某种程度上把脚下的地给我踩实了一点。它说的不是努力不值钱,是努力的着力点变了。以前你练手艺,现在你得练判断,得把一件事真正吃透,吃透到你能给 AI 当那个掌舵的人。

万能青年旅店有句词我老想起,「是谁来自山川湖海,却囿于昼夜厨房与爱」。我们这代做技术的,过去常常囿于那些重复的执行细节里,被分号、被环境配置、被一遍遍的调试磨掉大半精力。现在 AI 把这些接走了,理论上,我们终于有机会从厨房里抬起头,去看看山川湖海,去想想那些更大的、真正需要人来回答的问题,该往哪走。

当然,前提是你真的懂得往哪走。这工具很诚实,你带多少进来,它就还你多少。你脑子里有海,它替你扬帆;你脑子里是空的,它陪你原地打转,然后你 19% 的概率,关掉窗口,走人。

报告最后留了个我很喜欢的悬念。他们说会一直盯着这条「专业度回报」的曲线,如果哪天它开始往下走了,那就说明模型开始供给我们现在还得自己带进来的那份判断了,那才是真正天翻地覆的一天。

但至少现在,2026 年的这个夏天,答案还很清楚。

越懂行的人,越能从 AI 身上榨出价值。这事儿,值得你认真当回事。


参考资料(都是公开可查的官方来源)