AI 全自动写代码,卡住的不是模型,是没人敢签字

小岛AI 2026 / 07 / 27

16 个 Claude agent 并行开工,烧了不到两万美元,捣鼓出一个能用的 C 编译器。

这事儿单拎出来是篇爽文。但把它写进文章的人,紧接着补了一刀,同样这批前沿 agent,放到测「持续演进」的基准上,改着改着就把系统改散了。功能一个个都加上了,正确性和架构一致性却一轮一轮往下掉。能造出编译器的东西,守不住一个长期项目。

这两句话放在一起,出自伯克利 RDI 这两天发的一篇立场文,When Coding Stops Being the Bottleneck,当编码不再是瓶颈。RDI 是伯克利研究负责任智能的那个中心,文章背后还配了一份完整的 position paper,几十页,够啃一阵。

原文我从头到尾读了一遍。讲真,「AI 将彻底重塑软件工程」这种标题我这两年少说刷到过一百次,多数点进去都是车轱辘话,AI 快,AI 强,AI 改变一切,然后呢,没有然后。这篇不太一样。它没有喊口号,它干了一件很工程师的事。

划线。

类比对象选得很准,自动驾驶。自动驾驶行业早就明白一个道理,没有共同语言,安全和责任就没法讨论。SAE 那套 L0 到 L5 的分级出来之后,「辅助驾驶」和「有条件自动驾驶」才终于成了两个东西,每一级谁负责,清清楚楚。

软件这边呢。「自主编码 agent」这个词,现在什么都能指。可以是补两行代码的插件,可以是自己开 PR 的 agent,可以是自己测试自己部署的系统,甚至可以是自己决定做什么功能的东西。失败模式天差地别的四种系统,共用一个名字,讨论从第一句就注定鸡同鸭讲。

于是他们划了三级。标准只有一条,软件开发生命周期里的哪些环节,责任从人挪给了 AI。

一级,代码自主。AI 完整接管设计和实现,不需要人逐行批准。交付物是一个完整的 PR,设计理由、代码、文档全带着。人干什么呢,决定做什么,按 PR 粒度审核,看住测试和安全审计,把住部署的门。

注意,文章说今天的 AI 辅助编码只是这一级的「前奏」。按这个划法,今天拿 CursorClaude Code 用得飞起的你我,严格说还没进一级。

二级,流水线自主。从设计、实现到测试、审计、部署,整条线 AI 跑完。人不写代码,也不看代码,只提需求,然后验收最终行为。文章在这里用了个很重的词,qualitative break,质变。因为这一级偷偷押了两个假设,一是人类意图能被一份足够完整的规格接住,二是在没人检查中间产物的前提下,自动化验证依然可信。作者自己把话说死了,这两个假设,今天在任何有规模的场景里都不成立。

三级,需求自主。AI 连「做什么」都自己定,从监控数据、用户行为、安全公告、依赖变化里自己挖需求,自己排期,自己上线。人类在循环里的最后一个角色退场,只留一个创始使命当边界。这一级听着还比较科幻,先放一边。

三级自主矩阵,紫色块是责任完全交给 AI 的环节,图源 Berkeley RDI

框架本身讲完了。但我跟你说,有意思的不是框架,分级这个动作谁都会,PPT 里画三个箭头再配个火箭的人多了去了。这篇真正扎人的地方,是它顺手点名了一种已经在大量发生的姿势。

跳级。

什么叫跳级。一个团队名义上在一级运行,号称人对每个变更负全责,实际上呢,agent 产出的 PR 没人认真看就合进主干了。享受着二级的效率,没建二级的验证、治理和问责。文章管这个叫 mispractice,错误实践。我管这个叫真实生活。

你可以回想一下自己仓库里最近合掉的那几个 agent PR。点开一看,好家伙,diff 一千多行,CI 全绿,PR 描述写得比你自己的还工整。你认真看了前两个文件,心想模型现在真是强,往下拉了拉,滚轮越滚越快,approve。

别不好意思,很多人都这么干。说实话我 review agent 代码的时候,也得靠意志力撑着才能不直接点通过,那个「反正测试都过了」的念头,每次都在耳边劝你放过自己。

我的日常工作就是给模型搭脚手架,行话叫 harness,人话讲就是让模型真正能干活的那层工程,工具链、评测、重试、上下文管理都算。这个位置看到的真相是,agent 的产能早就超过人审得动的量了。产能这条线蹭蹭往上走,验证这条线基本没动,两条线中间豁开的口子,就是跳级。不是哪个团队堕落了,是所有团队都被同一股力推着走。

文章里有一句话,我给你原样端过来。

当同一个 agent 既写实现又写测试,测试全绿证明的可能只是一致性,不是正确性。

它自己出题,自己答卷,自己批卷,打了个满分。你想想看,这张卷子你敢信到什么程度。

一只手写卷子,另一只手盖章,这就是今天大多数 agent 流水线的验证现状

顺着这个往深处走一层,三个级别其实压着同一个难题,人类意图的保真。一级的时候,人还能靠 review 把意图捞回来。二级的时候,意图全押在一份没有人端到端核对过的规格上。三级的时候,连规格都是 AI 自己写自己养。你退得越远,意图越像传话游戏,传到最后一环,实现和测试互相一致,但一起错了。规格漂移、奖励劫持、多 agent 各干各的,看着是三种事故,其实是同一个病根。

所以我是真的觉得,一级到二级之间那道坎,不是模型能力的坎。模型下个版本还会更强,这事不用赌。坎在于,没有人看代码的前提下,谁敢为部署签字。

签字这两个字背后,要的是一整套今天还不存在的东西。能跟着仓库一起演进的机器可查规格,目标真正独立的验证 agent,出了事能翻的决策溯源。文章的研究议程部分承认得很坦白,这类评估基础设施今天几乎不存在,仓库级的规格基准、规格和实现之间漂移的长期评测,都还没有。没有这些,任何「我们已经可以无人化交付」的声明,都无法被证实。

也不是说所有一级团队都一个样。同样号称一级,两个团队的真实风险可以差一个量级,文章给了三个旋钮。第一个是规格粒度,一份带复现测试的 bug 报告,和一句「给系统加上多租户」,对 agent 是完全不同的约束强度,后者逼着它自己脑补范围、架构和成功标准。第二个是时间跨度,改一张工单,和连续自主跑三个月,后者会牵出记忆、回归、架构一致性这些一次性跑分根本测不出来的问题。第三个是监督模式,从逐操作批准到只监控加自动回滚,中间隔着好几档。给 agent 松绑之前,先看看这三个旋钮各自拧到了哪。

对着跳级这个病,作者开的处方叫显式的级别门禁。一个系统想晋级,得先拿出证据,证明当前级别的挑战已经被解决了,而且举证责任跟着自主性、运行时长和部署风险一起水涨船高。内部一次性小工具,你放飞一点没人拦你,动钱动数据的核心链路,就得按最重的标准举证。有点像考驾照,不是你买了辆更快的车,驾照就自动升一级。道理朴素到不好意思展开,但对照现实你会发现,现在大部分团队的晋级流程是反过来的,先上路,出了事再考虑要不要考试。

文章后半段开始推演,如果实现真的变得充裕,这个行业会怎么重排。

六大结构性转变一图总览,图源 Berkeley RDI

十个预测我不挨个复述,挑三个我记住的。

一个是规格会变成软件的基因组,代码只是它的一次编译产物。配套的推论有点狠,对能从规格忠实重建的系统,重新生成一份干净实现,可能比修补十年老代码更便宜。重构这门手艺,说不定会被重新生成取代一部分。

你可能会说,没人爱写规格文档啊,写了也没人更新。文章对这点想得挺明白,它预测的不是人人变成文档标兵,而是一种叫规格蒸馏的能力,人只管跟 agent 对话、给示例、做 review、纠错,agent 负责把这些零散交互持续编译成一份结构化的、跟着系统一起长的规格。你跟 agent 的聊天记录,最后会被熬成规格本身。文档不是写出来的,是蒸出来的。

一个是项目上下文会变成持久资产。规格、架构决策、工程惯例、评估历史,这些东西可能比任何一代代码都活得久。这条我举双手同意,现在带着 agent 干活的人应该都有体感,模型换一代,把提示词、规范和项目记忆搬过去,战斗力基本无损。代码越来越像耗材,上下文才是家底。

还有一个,软件变充裕,信任变稀缺。当生成一套定制软件的成本趋近于零,市面上最值钱的能力反而变成了溯源、验证、给 agent 发证。你看,绕了一圈又回到那道坎上,写代码的边际成本掉下去之后,敢签字的能力就成了稀缺资源。

当然这篇也不是句句都落地。比如它畅想 agent 之间会长出超越人类组织形态的协作方式,fork 执行状态、共享完整上下文、百万并发协作者,听着有点子牛逼,但离今天的生产环境还很远。今天的多 agent 系统,连让两个 agent 别互相覆盖对方文件都得靠加锁,谈百万并发,属于是给刚会爬的孩子报了体校。

要说看完能带走什么,我觉得是两个不花钱的动作。

第一,给你们团队标个级。别标对外宣传的那个级,标真实的那个。判据就一条,agent 的变更,是不是真的有人在看。

第二,如果答案是没有,两条路选一条。要么把 review 真的补回来,要么大大方方承认你们在往二级走,然后开始补二级的账,把规格写成能查的文档,把验证和实现分开,把回滚练熟。跳级不可怕,装作没跳才可怕。

我自己也还在摸索,上面这些也谈不上多成熟。但有一点我越来越确定,接下来几年,行业里稀缺的不会是能写代码的手,而是敢在发布单上签名的人。

开头那 16 个 agent 造出编译器的时候,没人给它们发毕业证。

因为考卷是它们自己出的。

8 月初伯克利会在 Agentic AI Summit 上接着聊这个话题,有兴趣的可以盯一眼。船越开越快了,掌舵的人没有变多,这大概就是我们这几年要一直面对的天气。