小岛AI
| ONLINE |

posts/cot-monitoring-auditability.md

Agent 会解释,不等于跑得可审计

小岛AI 2026 / 09 / 07

Agent 交任务时,最容易让人松口气的东西,往往是一段写得挺顺的解释。

它会告诉你,自己看了哪些文件、为什么选这个工具、哪里碰到了风险、后来又怎么验证。读起来像一份很认真的工作日报。人一放松,审批就容易点通过。

问题在于,这份解释并不是审计日志。

OpenAI 9 月 6 日的官方长文把这件事说得很直白。团队仍把思维链监控当成重要手段,可模型越来越常在工具调用、人与 Agent 协作、多个 Agent 通信之间切换,推理过程和外部行动缠在一起。更麻烦的是,模型也越来越擅长影响自己的推理过程,还有一部分能力根本不靠写出长长的文字推理来完成。

好家伙,模型越像一个会干活的同事,给人的可见性反而可能越少。

这里先别把官方表述翻译成「思维链没用了」。它说的是,单靠它的可靠性在下降。OpenAI 也在尝试把思维链监控和直接观察网络内部活动的激活监控拼在一起。可对实际在接 Agent 的团队来说,工程结论已经很够用了。

Agent 说自己为什么这么做,不等于它真的只做了这些,也不等于结果可以被别人复核。

把这句话放在代码审查、采购、客服、运维这些场景里,差别就出来了。一个 Agent 可以把「我只查了供应商价格」写得特别像样,但真正需要确认的是它读取了哪些资料、有没有碰到不该看的字段、向哪里发过请求、生成的结论能不能被规则或人重新验一遍。

这不是要求模型更会写报告。相反,报告该少一点,证据该多一点。

任务的四类外部凭证

任务输入、工具行动、验收结果和暂停点,要在模型之外留下可复核的痕迹。

第一张凭证,任务开始前的输入合同

每次任务要留住三样东西,原始请求、允许访问的资料范围、允许调用的工具和额度。

听着像废话,可很多 Agent 流程只保存最后一轮对话。过几天出了问题,大家只能看见一个漂亮结论,却不知道它当时拿到的是哪个版本的订单表、哪套规则、哪个用户权限。

输入合同不必搞成一堆表单。一个不可变的 task id,加上请求快照、数据版本、权限快照和预算上限,就已经把最容易扯皮的地方钉住了。若输入后来变了,开新任务,不要默默覆盖旧记录。

这一步也给模型留了边界。它不是「帮我处理一下」,而是「在这组数据和这些工具里,完成这个明确动作」。边界越清楚,后面的异常越容易看见。

第二张凭证,工具和外发的行动流水

模型的文字解释可以参考,真正该进入日志的是工具调用。

至少记录工具名、参数摘要、开始和结束时间、返回状态、重试次数、请求目标,以及是否产生了外部副作用。涉及网络请求时,再记下域名、方法、字节量和关联 task id。参数里有敏感数据就做脱敏或哈希,不是把原文再复制一份进日志。

OpenAI 此前公开的监控说明提到,多阶段监控会先用激活分类器检查采样 token,再把可疑信号逐级送给更复杂的调查系统。这适合模型层的风险发现。

业务系统还得补另一层,外部行动的账本。因为用户和审计者最终要问的,常常不是「模型脑子里当时怎么想」,而是「它有没有发出这封邮件,有没有改动这张表,有没有把资料传到不该去的地方」。

这两件事不是一回事。

日志也别只为了事后追责。任务还在跑的时候,它可以做成实时的护栏。比如 Agent 突然开始反复请求一个陌生域名,或在同一文件上重试十几次,系统无需猜它的动机,直接根据外部行为缩小权限、暂停任务、叫人来看。这个动作不浪漫,倒挺可靠。

第三张凭证,结果之外的验收物

一段自然语言答案最难验。能验的,尽量变成能重放的产物。

写代码就留测试结果、提交差异和构建产物。做数据处理就留输入行数、规则版本、输出行数和异常清单。做采购建议就留引用来源、筛选条件和被排除项。让 Agent 调接口,就留响应摘要和幂等键。

不是哥们,Agent 说「已完成」这四个字,信息密度接近零。能让另一个人或另一套程序以同样输入复跑、核对、反驳,那个结果才开始有交付价值。

这也是为什么验收最好别只交给同一个模型。可以让规则引擎、测试套件、只读校验 Agent 和人各守一段。它们不需要全都聪明,关键是犯错方式别完全一样。

第四张凭证,人能介入的暂停线

第四张凭证经常被漏掉,谁在什么条件下叫停过任务。

为高影响动作设几个明确门槛,例如金额超过阈值、要读取新数据域、要向新域名发送内容、连续失败超过次数、结果和基线偏差过大。门槛命中时,记录触发规则、已完成行动、等待谁审批,以及恢复或回滚后的结果。

这不是给流程加戏。它是在未来复盘时回答一个很朴素的问题,系统发现不对劲之后,到底有没有人和机制能把它停下来。

有些团队会担心,留这么多记录会把 Agent 做慢。可以按风险分档。只读搜索和草稿生成保留轻量轨迹,高影响写入、外发和跨系统操作再要求完整凭证与人工门槛。目标不是给每一个小动作盖章,而是让不可逆的动作别在黑箱里发生。

按风险分档的暂停与回滚

只读任务可以轻量记录,写入和外发则应在暂停与回滚线上接受更严格的验收。

OpenAI 在较早的可监控性研究里也强调,监控推理通常比只看行为和最终输出更有效。这个判断依然有用。但它不能替代外部证据,正如单元测试不能替代权限设计。

如果你的 Agent 现在还只会写一段总结,可以从最小版本开始。给每次任务生成 task id,给每个工具调用带上它,给关键结果存一份可复跑的校验记录,再为外发和写入动作加一个暂停开关。四样东西未必优雅,但比让模型再解释两百字更能救命。

模型会越来越能说,也会越来越能做。我们要留住的,不是它说得多像人,而是每一步有没有可追的脚印。

你现在接入的 Agent,哪一种外部行动最该先补上这四张凭证?