你收藏的 AI 神技巧,GitHub 亲口说多半是噱头

小岛AI 2026 / 07 / 28

昨天 GitHub 官博发了篇文章,标题起得挺狂,The harness is all you need (mostly)。懂行的一眼能看出来,这是在致敬 transformer 那篇开山论文 Attention Is All You Need,注意力就是你需要的一切。GitHub 把 attention 换成了 harness,还谨慎地在括号里补了个 mostly,基本上。

先把这个词翻译一下。harness 直译是马具、缰绳,在 AI 圈指的是包在大模型外面的那层工程,工具调用、权限控制、子 agent 调度、上下文管理,让模型真正能干活的那套脚手架。你每天在用的 Claude Code、Copilot CLI、Cursor,剥掉界面,里面那个决定 agent 什么时候读文件、什么时候开子任务、什么时候停下来问你的东西,就是 harness。

这篇文章我看得比一般人仔细一点,因为搭这层脚手架恰好是我的本职,天天的工作就是看模型在各种 harness 里怎么跑、怎么翻车。所以 GitHub 官方亲自下场说 harness 才是关键,对我来说不算一条资讯,更像是行业把一件事挑明了。

挑明的是什么,我跟你说,就藏在文章开头那几段。作者 Burke Holland 上来先共情,说如果你现在被 AI 搞得不知所措,你不是一个人,每天都有新工具、新 MCP、新模型、新 skill、新工作流,每个都宣称「看,我用这一个神奇 prompt 彻底搞定了 AI」。然后他跟了一句。

我不信。

他说自己每天都在用 AI,发现的是 less is more,装了什么、配了什么、用什么花招骗 agent 干活,那些东西有意思,但到头来都像噱头。真正的提升来自你怎么用 harness,以及你对它理解得有多深。

好家伙,这话从 GitHub 嘴里说出来,分量不太一样。要知道过去一年整个生态都在拼命往上堆东西,MCP 市场、skill 市场、awesome-prompts 仓库一个比一个大,你的收藏夹里大概也躺着几十条「让 AI 效率翻倍的 30 个技巧」。现在平台方自己出来说,那些多半是噱头,把基本功练好就行。

那基本功长什么样。文章给了一个八步工作流,通稿部分我压缩着讲,快进快出,重点聊几个别的号大概不会聊的细节。

流程本身朴素到几乎让人失望。选一个工具,随便哪个,反正 CLI、GitHub Copilot app、VS Code 背后是同一个 harness,学一次到处用。打开 YOLO 模式,也就是 Allow All,让 agent 不用每一步都请示你,但要放在 Codespaces 或者 dev container 这类沙箱里跑。动手写代码之前先让 AI 出原型,作者的开场 prompt 是「给我 20 个日期选择器的 mock,全放在一个 HTML 文件里方便对比」。然后进 plan mode,让模型反过来拷问你。计划敲定,交给 Autopilot 自动实现。人工审查,迭代到满意。最后请一次 rubber duck review 收尾,提交,开新会话。

一条 prompt 生成的 20 个日期选择器原型,全在一个 HTML 里对比(图源 GitHub 官博)

单看每一步都不新鲜,对吧。但有三个细节,我觉得值得单拎出来说。

第一个是 Autopilot 里的自动编排。Autopilot 是个内置循环,强制模型把计划里每一项真的做完才许停,防的就是那种干到一半宣布胜利的老毛病。跑的过程中 Copilot 自动当调度员,读文件这种轻活派给小模型驱动的 Explore 子 agent,复杂的活派给大模型驱动的 General Purpose 子 agent。文章特意强调,这些你什么都不用配,开箱即用,哪怕你根本不知道子 agent 这个概念存在。这句话翻译过来就是,多模型编排已经从高级玩法降级成了默认行为,用户甚至不需要知道它发生过。

计划敲定后,Copilot 给出 Plan summary 并推荐一键交给 Autopilot 实现(图源 GitHub 官博)

第二个是 rubber duck review,这个设计有点子牛逼。你可以在任何节点随口让 Copilot 做一次小黄鸭评审,它会去请一个不同家族的模型来审。作者用 GPT 5.6 Terra 写的代码,Copilot 转头请了 Claude 的 Sonnet 来挑毛病。理由很朴素,不同模型的训练数据不同,盲区也不同,第二双眼睛得换个脑子。你想想看,这可是 GitHub 的官方产品,微软的地盘,产品里内置的最佳实践居然是请 Anthropic 的模型来审 OpenAI 模型写的代码。在 harness 这一层,模型忠诚度这个东西根本不存在,谁的盲区互补就用谁。

第三个藏得更深,是省钱的部分。文章建议你在一个功能的完整周期里坚持用同一个模型、同一个推理档位,原因是 prompt 缓存,只要不切换,之前的对话都还躺在模型侧缓存里,后续请求有折扣。这种建议以前只出现在 API 账单被打爆之后的复盘帖里,现在被写进了官方入门工作流。挺好的,平台终于开始教用户省钱了。

再说一个我很喜欢的小设计。plan mode 的价值不是帮你写计划,是帮你发现你根本没想清楚自己要什么。作者拿日期选择器举例,模型会追着你问,起止日期可以相同吗,部分选择合法吗,用户能清空日期吗,允许手动输入吗,日期用什么格式存储。你不可能提前想到所有边界情况,但模型可以帮你逼出来一大半。嫌拷问得不够狠,还可以装 Matt Pocock 的 grill-me skill,让计划环节变成审讯环节。这一步省下的是最贵的返工,方向错了,后面 agent 跑得越欢,废掉的 token 越多。

plan mode 加上 grill-me 后的拷问现场,连第四个选项都是模型自己的灵魂发问(图源 GitHub 官博)

看到这里你可能会说,这不就是一篇 Copilot 软文吗。坦率讲,是,它当然想让你用 Copilot。但我觉得这篇的信号价值大于内容价值,原因在于一个很有意思的现象,如果把文中的工具名全部遮住,这套工作流跟 Claude Code 社区这一年摸出来的最佳实践,几乎一模一样。

Claude Code 有 plan mode,Copilot 也有 plan mode。Claude Code 有 subagents,Copilot 有 Explore 和 General Purpose。Claude Code 社区流行让两个模型互相 review,Copilot 直接把它做成了 rubber duck 命令。Claude Code 有 skills,Copilot 这边作者也顺手装了个 skill 来加强 plan mode。两家在没有商量的情况下,长成了同一个形状。

生物学里管这个叫趋同演化。海豚和鲨鱼没什么亲缘关系,但因为都在海里讨生活,都长成了流线型。agent 工具也一样,原型、计划、实现、审查这个形状不是哪家的产品天才拍脑袋想出来的,是大家在同样的约束下,被同样的翻车方式毒打出来的收敛解。模型会半途而废,所以要有循环强制它干完。单个模型有盲区,所以要跨家族互审。上下文窗口有限,所以要按话题开会话。你去翻,每一条设计背后都对应着一类真实的生产事故。

这也是为什么我一直觉得,模型之争正在让位于编排之争。模型还会继续变强,但对一线工程师来说,换模型越来越像换轮胎,harness 才是那台车。而车的形状已经收敛了,方向盘、油门、后视镜就在那些位置,学会开一台,换个牌子照样上路。

当然,这篇官博也有它不会告诉你的部分,我补三条。

一是 YOLO 模式的风险被轻轻一句带过了。文章说 bad things happen to good people,甩了个事故帖链接就翻篇。但 Allow All 加本地环境,等于把 rm -rf 的钥匙交给一个会产生幻觉的实习生,沙箱不是可选项,是前提。这一步做不到,宁可老老实实按批准按钮。

二是 rubber duck 循环很烧钱。作者自己也承认这步费 token,让两个模型循环互审直到双方都觉得只剩收益递减项,那个「递减」是拿真金白银堆出来的。团队项目值得,个人小项目量力而行,别为一个日期选择器烧出一顿火锅钱。

三是「学一次 harness 到处能用」这话只对了一半。工作流的形状确实通用,但每家的命令、配置、skill 格式并不通用。GitHub 说 harness is all you need 的时候,它心里想的是 our harness。各家嘴上讲通用,手上都在修自家的默认路径,这个小算盘不影响文章本身的价值,但你心里得有数。

那对普通开发者来说,到底该把学习时间押在哪。我自己的感受是,押在形状上,别押在具体咒语上。

具体点讲。收藏夹里那些神 prompt,大概率半年后就过期了,作者原话说得更狠,今天的神奇咒语,很多会成为明天的反模式。但先出 20 个原型再动手、让模型拷问你的边界情况、请另一个家族的模型来审代码、一个话题一个会话,这几个习惯换什么工具都成立。前者是背题,后者是学解法。背题的人换张卷子就完蛋,学解法的人换个考场照样做。

写到这儿,想起文章里我最喜欢的一段。作者迭代日期选择器的时候,给模型发的全是大白话,这里不用缩放、顶部那行字去掉、悬停文字看不清、点今天要跳回日视图。没有任何技巧,就是一个有品味的人在毫不客气地提要求。他说,最重要的是别接受差不多得了的产出,对质量要毫不留情,分辨什么是好东西什么不是,这个价值没有任何 AI 能替你提供。

怎么说呢,兜了一大圈,最后压舱的还是品味和判断。工具在收敛,模型在轮换,收藏夹里的技巧在批量过期,但你对好坏的直觉、对边界情况的嗅觉、对差不多得了的零容忍,这些是跟着你走的。船可以换,罗盘是自己的。

对了,原文值得完整读一遍。读的时候可以顺手做个小实验,把里面的 Copilot 全替换成你正在用的工具,看看有多少句话依然成立。我自己读的时候试了一下。

几乎全部。