他让一个 Fable 当总包工头,把编码 token 砍掉八成

小岛AI 2026 / 06 / 14

这两天在 GitHub 上刷到一个仓库,叫 architect-loop,挺有意思。

它干的事一句话能说清,让一个聪明又贵的模型只负责动嘴,让另一个便宜的模型埋头干活。前者叫 Claude Fable 5,在这套流程里它的身份是架构师,从头到尾不写一行代码。后者是 GPT-5.5 Codex,所有脏活累活都它来。仓库地址我放这了,https://github.com/DanMcInerney/architect-loop ,作者是 Dan McInerney。

我第一眼看到这个分工的时候愣了一下。因为它跟我们这帮人平时偷偷摸摸在干的事,几乎一模一样,只不过人家把它做成了一套能装、能跑、有规矩的东西。

先说说为啥这事戳到我了。

现在但凡你认真用过 Claude Code(https://claude.com/claude-code )这类编码 agent,应该都体会过一种肉疼。就是那个最聪明的模型,特别能花钱。你让它从头到尾把一个功能啃下来,它得先读代码、再想方案、再吭哧吭哧写实现、再回头改 bug,整个过程全程占用着最贵的那颗脑子。可你冷静想想,这里面真正需要顶级智商的,其实就是想方案和最后验收那两下。中间那一大坨敲键盘的体力活,换个便宜点、手脚麻利点的模型,照样能干。

architect-loop 就是把这个直觉给落地了。贵的模型当包工头,便宜的模型当施工队。

网上传这套能省八成 token,我得在这儿先打个补丁。我去翻了它的 README,从头到尾没找到 80% 这个数字。这个说法是社区和资讯标题转出来的,不是作者自己拍胸脯的承诺。能坐实的事实是这样,那颗贵脑子(Fable)在整个流程里只做分钟级的规划和审核,真正以小时计的繁重实现,被外包给了跑在另一套订阅配额上的执行模型(Codex)。省的是贵那一头的用量,至于到底省几成,看你项目多大、活多重,别把八成当成标称功耗。

好,补丁打完,咱接着聊它到底怎么转的。

整套东西就两个命令。一个叫 /architect,是干活的循环。一个叫 /architect-research,是查资料的循环。你装好之后(号称 30 秒,git clone 然后跑个 install 脚本,再 npm 装一下 Codex CLI,就是 OpenAI 那个 @openai/codex,https://github.com/openai/codex ),平时就敲这俩。

我最服的,是 /architect 这个干活循环的设计,它处处透着一股不信任。注意,是健康的那种不信任。

它的第一条规矩是,先写规格和验收闸门,再开工。

什么意思呢。架构师 Fable 接到活之后,不会上来就让施工队冲。它先把这一轮要干的事切成一个小到能塞进一个 PR 的切片,再把这个切片拆成一到四条平行的车道(lane),还要检查这几条车道碰的文件有没有重叠。最关键的是,它会把验收标准(这个项目里叫 gates,闸门)提前写死,提交到 docs/gates/ 这个目录里,然后才允许任何一个施工队动手。

这些闸门是只读的。施工队要是手贱去改了闸门文件,这条车道直接判负。

好家伙,你品品这个设计。这相当于盖楼之前,监理先把验收单贴墙上,钉死,施工队不许碰。我看到这儿没绷住,因为这太懂 AI 了。但凡跟大模型打过交道的都知道,你要是让它自己定标准自己考自己,它能给你考出花来,每道题都满分,楼是歪的。

第二条,施工队是关在小黑屋里并行干活的。

每条车道起一个全新的 Codex 进程,而且每个都待在自己独立的 git worktree 里。worktree 这玩意可能有的朋友不熟,简单说就是同一个仓库,给你拉出好几个互不打架的工作副本,几个施工队各干各的,谁也别想推倒谁砌好的墙。

更有意思的是对施工队的要求。它们动手之前,必须先跟规格吵一架。原文写得很直白,silent compliance = defect,闷声照做就算缺陷。也就是说,你扔给它一个方案,它要是一声不吭就开干,这本身被当成 bug。它得先质疑,先挑刺,觉得这方案哪不对得先说出来。而且它只能改自己声明过要碰的那些文件,干完只许汇报原始结果,连提交代码的权限都没有。

我太喜欢这条了。我们用 agent 最大的恐惧,从来不是它不干活,而是它一边出错一边特别自信地跟你说没问题。逼它先开口反驳,说到底就是在防这个。

第三条,验收和合并,只认架构师亲手跑出来的结果。

施工队说自己测过了,全绿。Fable 信吗。不信。它自己把闸门命令重新跑一遍,原文管施工队的自我汇报叫 hearsay,传闻。光跑通还不够,它还要对着当初规格的意图去读那个 diff。因为它很清楚一件事,测试全过不等于这活能合并。施工队太擅长把看得见的测试演得漂漂亮亮,可那个 PR 拉出来一看根本没法用。所以最后得有一双眼睛去看真实的改动。确认没问题了,才提交、合并。而且这个验收是在一个全新的会话里做的,因为有研究表明,不带前文污染的复审更靠谱。

第四条,也是我觉得最有哲学味的一条,仓库是唯一的记忆。

它有句话我特别喜欢,Not in the repo = didn’t happen,没进仓库就等于没发生过。所有的交接信息浓缩成一个 docs/HANDOFF.md,就一张精简的目录,每个会话都修剪一次,不许它长胖。细节全藏在链接出去的闸门文件和车道文件里。它给的理由很朴素,记忆文件会腐烂。

这个我真的有体感。你让一个 agent 维护一份越写越长的上下文笔记,写到后面那份笔记自己就成了一团乱麻,模型读它比读代码还费劲。所以干脆,别让记忆住在某个模型的脑子里,让它住在仓库里,住在 git 历史里,住在一个个能被重新跑一遍的闸门里。代码仓库本来就是程序员最诚实的记忆,谁也别想嘴硬。

这套东西背后的每一个选择,作者都标了出处,全写在 DESIGN.md 里,https://github.com/DanMcInerney/architect-loop/blob/main/DESIGN.md ,里面有十二条强制规则和一张失败模式对照表。我扫了一遍引用,不是那种随手攒的项目,是真读了不少论文和工程实践才搭出来的形状。比如它有一条结论我盯着看了半天,弱的规划者比弱的执行者危害更大。所以才让最强的模型去做设计,让施工队拿到的是明明白白的规格。想想还真是,方向错了,施工队越能干,翻车翻得越彻底。

另一个循环 /architect-research,是给你还没想清楚要做啥的时候用的。它的玩法是侦察兵先行,跟那些正经的深度研究系统一个路子。先派一个便宜的 Codex 侦察兵把题目的地图画出来,大概搜十来次,摸清楚术语、关键论文、关键人物、还有这个话题天然吵架的地方在哪。然后 Fable 根据这张地图,现场设计三到六条研究车道,再派一堆 Codex 研究员在硬预算下并行去查。每条车道最多碰五个主题,搜够了就停,发现必须带 URL 带日期带引文带置信度,找不到就老老实实写找不到,绝不许瞎编。最后 Fable 来核实和撰写,每个承重的论断至少要两个独立信源,还要做对抗性的证伪搜索,只引用真正抓取过的链接。

作者把研究单独拎出来当第二个 skill,理由特别实在。研究级的并行大约要烧掉聊天级十五倍的 token,这么贵的动作,得是你主动按下去的,不能让它在干活的循环里不小心就触发了。这份克制我给满分。

说到钱,它整套默认不需要任何 API key。Claude Code 跑在你的 Claude 套餐上,Codex CLI 跑在你的 ChatGPT 套餐上,用的都是你已经付过的订阅。施工队那些跑几小时的活,吃的是 ChatGPT 套餐里那个五小时窗口和每周配额,而架构师 Fable 的会话是分钟级的。你看,省钱的逻辑就藏在这句话里,把最贵的脑子的工时压到分钟,把按小时计的体力活赶到另一个计费池子里去。

这套思路的源头,作者也老老实实交代了,来自 X 上 @jumperz 的一条帖子,https://x.com/jumperz/status/2065454404623384859 ,讲的就是用 Fable 配 Codex 子 agent。Dan 说他找不到现成的方式跑这个模式,干脆自己搭了一个,顺手加了点运维上的最佳实践。你想想,一个人深夜在 GitHub 上敲下 install.sh,把别人推文里一句灵光闪现的点子,硬生生做成一个能 clone 下来就跑的东西,还认认真真写了带十二条规则的设计文档。这种把闲聊变成作品的劲儿,是开源社区里最动人的东西。

聊到这我得往回收一收。

我们这一年到底在 agent 上学到了什么。一开始大家都迷信单个超级模型,觉得给它足够强的脑子,它能一条龙把所有事干完。后来撞了无数次墙才慢慢明白,真正能 work 的形态,可能恰恰是不信任。是分工,是隔离,是把验收标准提前钉死,是让最强的脑子退到后面只管判断,把前线交给一群关在小黑屋里、互相吵架、干完就走的施工队。

这听着是不是有点耳熟。这不就是人类几百年来组织复杂工程的老办法吗。监理、施工队、验收单、互不干扰的工位、白纸黑字的合同。我们绕了一大圈,用最前沿的模型,重新发明了一遍工地管理。

万能青年旅店有句词,是谁来自山川湖海,却囿于昼夜厨房与爱。我看着 architect-loop 这套东西忽然觉得,再聪明的模型,最后也得囿于规格、闸门和 git 历史。自由从来不是没有约束,是约束得恰到好处,让每个部分都能发挥到位,又不至于互相踩死。

我还没在自己的项目里把它完整跑一遍,这两天就先翻了翻它的 SKILL.md 和 dispatch.md(https://github.com/DanMcInerney/architect-loop/blob/main/skills/architect/SKILL.md ),光是读那些规则的措辞就挺过瘾,每一条背后都像是被某个具体的坑教育过。等我哪天有空,准备拿它来啃一个真实的小项目,到时候踩了什么礁石再回来跟你唠。

如果你也整天跟编码 agent 打交道,被它的 token 账单或者那种自信满满的胡说八道折磨过,真心建议去把这个仓库的 README 和 DESIGN 读一遍。不一定非得装,光是看它怎么把不信任工程化,就够你顺着重新审视一遍自己手里的 agent 流程了。

毕竟在这片海上航行,最值钱的从来不是船开得多快,是你知道哪里有暗礁。