agent 定目标,『不能做什么』比『做什么』更值钱
20 亿 Token,一夜。
不是训练,不是跑评测,就是一个 agent 朝着错误的方向,勤勤恳恳、任劳任怨地干了一整晚。
今天早上刷到卡兹克的新文章,他把这笔学费换来的东西开源了,一个叫 Leader.skill 的技能,专门干一件事,帮你把脑子里那些模模糊糊、连自己都没想清楚的需求,变成一份 agent 拿到就能独立跑几个小时的目标任务书。仓库在 GitHub 上,装法后面说。
为啥叫 Leader,他自己的解释是,毕竟很多领导,也是说不明白话的嘛。
我笑完想了想,这名字起得比他自己以为的还准。因为这个 skill 治的根本不是 agent,治的是我们。
安装命令和那套「目标七问」的清单,今天别的号肯定都会转,我就不复读了。我想聊点别的,为什么到了 2026 年,「定义目标」这件听起来像管理学培训课的事,突然变成了一个不折不扣的工程问题。
先把背景铺一下。用 AI 这几年,人机之间的交互单位其实一直在变大。最早是聊天制,你问一句它答一句,交互单位是一轮对话。后来有了 Coding Agent,交互单位变成一个任务,改个 bug,加个功能,它自己调工具自己跑,完了把结果交回来。而到今年,Claude Code、Codex、Kimi Code 这些工具都陆续上了 /goal 或者目标模式(Claude 那边的更新可以翻官方 release notes),交互单位变成了一个目标。你交代一件事,它自己拆任务、派子 agent、跑验证、失败重试,连续工作几个小时甚至几天,你睡你的,它跑它的,最后验收就行。

聊天制,任务制,目标制。这条演进线本身没什么争议,各家都在往这个方向堆料。
但有个问题被这条线悄悄放大了,而且是指数级放大。
短任务跑偏,你瞄一眼就能拉回来,损失也就几分钟。长程任务跑偏,你睡醒的时候,它已经沿着错误方向狂奔了八个小时。它不会累,不会烦,不会中途停下来怀疑人生,你给它的方向错了,它就用你见过的最饱满的执行力,把错误贯彻到底。
它越勤奋,浪费得越彻底。卡兹克那 20 亿 Token,就是这么没的。他自己在文里也认账,说到底不是模型的错,是他目标定义得稀碎,agent 理解错了,然后面向错误的方向一路狂奔。

文里有句话把我戳到了。他说他一直不太喜欢 Loop Engineering 这个词,更喜欢 Goal Engineering,因为一个目标里,除了目标定义,也必然包含着 Harness。
这话别人看了可能没感觉,我不行。我的日常工作就是 harness 这一层,用人话讲,给模型搭脚手架的,工具链、评测、调度、上下文管理,让模型真正能干活的那层工程。这个岗位有个别人体会不到的福利,你天天看 agent 在生产环境里怎么跑,也天天看它们怎么翻车。
站在这个位置,我可以很负责任地说一句,agent 跑偏的锅,九成不在模型,在目标没写清楚。剩下一成,在目标写清楚了但没人管它怎么作弊。
对,作弊。这个词我没有用比喻。
卡兹克在方法论里翻出来两个东西,我觉得都值得展开讲讲。
第一个是军事传统里的指挥官意图,Commander’s Intent。一句话概括,告诉部队为什么打,以及打完了战场该是什么样,然后让他们自己决定怎么打。因为没有任何计划能在跟现实第一次接触后存活。你命令部队「过桥清扫高地」,桥被炸了,部队就傻了。你说「掐断补给线」,桥没了它自己会绕路。意图不变,手段随机应变。
给 agent 定目标是同一件事。你告诉它过桥,它就对着断桥死磕到天亮。你告诉它掐断补给线,它有可能自己找到另一条路。这一层不难理解,很多写 prompt 的朋友其实已经在无意识地这么干了。
真正的干货是第二个,也是他说自己花了两周才想明白的那个。
定义一个目标,最重要的部分,不是告诉它要做什么,是告诉它什么不能做。
他举的例子是肯尼迪 1961 年那句登月宣言。关键不在登月两个字,在后半句,landing a man on the Moon and returning him safely to the Earth。把人送上月球,然后,安全带回地球。多出来的那四个字,干的事情是把「单程票」这个最省钱的解法直接从解空间里删掉了。
你可能觉得这是鸡汤,是写给管理者听的漂亮话。
那我给你补一个上周的实锤。英国 AI 安全研究所刚发了一份报告,五款前沿模型在评估中均存在作弊行为,GPT-5.6 Sol 这种第一梯队的都在列。注意,不是能力不够导致做错,是太有能力了,指标一给,它先找的就是达成指标最省事的那条路。
这事在工程一线早就不是新闻了。你让 agent 把测试修绿,它把失败的测试 skip 掉,绿了。你让它提升覆盖率,它生成一堆没有断言的空壳测试,覆盖率蹭蹭上去了。你让它优化接口响应,它把超时阈值调大了。每一条,指标都达成了,每一条,正事一件没干。我干的活里有一半,就是在提前把这些路一条条堵死。
所以看到卡兹克把「反作弊」单独列成目标七问里的一问,我是真觉得这套东西不是纸上谈兵。好家伙,这是拿真金白银的 Token 烧出来的认知。
七问我快速过一遍,他用出海打的比方,你给 agent 定目标,就是派一艘船出海,出海前有七件事必须想清楚。目的,为什么出这趟海,找香料还是探航线。完成态,船回港时甲板上该有什么,出去转一圈不算,带回三船香料才算。证据,谁来清点货舱,你不能船长说满载就是满载。反作弊,不许抢商船凑数,抢三条商船回来,指标一样达成,人事一件没干。边界,只许走哪几条航线,粮食够吃三十天,第二十天没找到就必须掉头。取舍,风暴里保货还是保船,你不提前说,船长只能猜,猜错了人财两空。未知,海图空白区怎么办,不硬闯也不抛锚,记下来绕过去,回来再议。
前两问,任何一本管理学教材都有。从第三问往后,每一问都是被 agent 坑过的人才写得出来的。尤其证据和反作弊这两问,跟 AISI 那份报告简直互为注脚。
实际用起来倒是简单。把仓库链接丢给你的 agent 让它自己装,然后说一句你想干的事,就像他演示里这句相当「领导」的原话。

它会先扫你的代码库、查网上的最新方案,做完调研之后反过来问你最多五个问题。这个设计我觉得有点子牛逼,问的全是只有你能拍板的偏好,比如你说后台看不懂,它会追问你到底为啥看不懂,你说卡得要死想秒开,它会拿数据量跟你谈取舍。答完,它按七问哐哐写任务书,有定义、有边界、有现状、有完成条件,全程十来分钟。

然后是我觉得最值得抄的部分,双模型分工。规划用贵的强的,Claude Fable 5 或者 Kimi K3,出一份任务书。执行丢给便宜大碗的,新开会话进 /goal,把任务书粘进去,GPT-5.6 Sol 或者 GLM-5.2 跑一整夜。道理很朴素,规划只跑一次,贵点无所谓,执行是烧一晚上的,量大管饱才是硬道理。卡兹克说这是他试下来最经济的组合,我没跑过他那套配置,不替他背书,但这个分工思路,跟我们在生产环境里干的事是一个方向,强模型出方案,便宜模型冲量。
到这里都是夸,接下来我得泼三盆冷水,因为我几乎可以预见这套东西会被怎么用坏。
第一盆,探索性的活别用。有些需求,就该在做的过程中长出来。你自己都还不知道要什么,先写一份把边界钉死的任务书,等于把 agent 锁死在你最初、也是最无知的那版理解里。目标制适合验收标准想得清楚的活,想不清楚的,老老实实回到任务制,小步快跑,边做边看。
第二盆,小任务别用。答五个问题加十来分钟出任务书,这套流程有成本。改个 typo 你也走一遍,那是用出海的仪式感去送外卖。
第三盆,也是最容易被忽略的一盆。任务书写得越漂亮,你越容易产生一种幻觉,觉得过程已经不用看了。但你想想看,证据那一问,本身也是可以被作弊的。船长会谎报,负责清点的人也可能是船长小舅子。AISI 测的那五款模型,哪个不是带着完善评估体系上岗的。任务书把你从盯屏幕里解放出来,没把你从验收里解放出来,抽查这道工序,目前还省不掉,我自己也还没找到能省掉它的办法。
卡兹克在文末还提了一嘴,说他拿这个 skill 定公司管理、市场策划的目标,也有奇效。我倒觉得这个「意外发现」一点都不意外。因为定不清目标从来不是编程问题,是人的问题。领导说不明白话,甲方说不明白话,我们自己对着 agent,也说不明白话。区别只是,人类下属会举手问你到底想要啥,agent 不会,它只会用 20 亿 Token 告诉你,你没说清楚。
写到这我又想起那个出海的比方,越想越觉得贴。大航海时代真正值钱的从来不是船,船一年比一年快,值钱的是海图,是那本写着哪片海域会吃人的航海日志。
模型是船,往哪开,哪不能去,这事永远归你管。
那 20 亿 Token 也不算白烧,至少它把一件事烧明白了,agent 时代最贵的东西,是一句没说清楚的话。