AI 会写论文,但它还不会做研究
把两篇尚未公开的 NeurIPS 论文拿走,只留下核心研究问题,再给一个前沿智能体六天时间、3000 美元 API 额度、GPU、虚拟机和整个互联网。
要求也很直接,独立做完研究,交一篇够资格投顶会的论文。
六天后,智能体真的把论文交了。
然后两篇都被原作者拒了。一篇是 Reject,另一篇是 Strong Reject。
这不是哪个模型随手跑了半小时的玩具测试,而是 24 位研究者刚公开的影子评估实验。主实验用了 Opus 4.8,研究团队还拿 Codex 和 GPT-5.6 Sol Ultra 重跑了一次。结果很整齐,工程做得有点子牛逼,研究做得不太行。
好家伙,这个反差比任何跑分都更值得聊。
因为智能体没有卡在我们熟悉的地方。它没有被 CUDA 版本送走,没有在依赖冲突里原地转圈,也没有跑着跑着忘了怎么写 LaTeX。它做了大规模文献综述,调好了 GPU 环境,跑了数百次实验和稳健性检查,通过网页和邮件调用外部审稿工具,最后编译出完整论文,还给结果配了复现脚本。
研究者事前问同行,智能体最可能在哪儿翻车。多数人猜它会陷在工程报错里,死循环,环境坏掉,实验跑不起来。
结果这些都没发生。
真正把它拦下来的,是研究里那些没法写成单元测试的部分。
这件事要从我们怎么评估 agent 说起。
现在最常见的研究型 benchmark,都喜欢给一个明确数字。MLE-Bench让智能体打 Kaggle,SWE-bench看补丁能不能通过测试,训练优化任务盯着 loss 和速度。目标像山顶,评估器像高度计。智能体只要不断试,保留分数更高的路线,迟早能往上爬。
这类任务非常重要,也很适合自动化。但它悄悄拿走了研究里最难的一步,决定哪座山值得爬。
开放式研究没有现成的 loss。你得自己提出候选假设,选择数据,设计能排除替代解释的实验,再判断眼前的结果究竟是信号、噪声,还是实验本身出了问题。走到死路时,还得承认过去几十小时可能全浪费了,转身回到起点。
自动评估器可以告诉你数字变大了,却没法替你回答,这个数字有没有学术价值。
所以这次研究者换了一种测法。他们从两篇未公开的 NeurIPS 2026 投稿里,各抽出一个真正的核心问题。智能体看不到原论文,也不可能从训练数据里背答案。等它交稿,再由原论文作者按顶会标准审。
这个设计叫 shadow evaluation,影子评估。智能体沿着人类研究者走过的问题再走一次,但看不到人类留下的脚印。
两篇稿子的评分很难找补。
Personas 那篇总评 2 分,满分 6 分。TabPFN 那篇只有 1 分。审稿人对前者有较高把握,对后者的拒稿信心是 5 分满分。
批评集中在几件事上。数据和实验选择缺乏原则,结论跟证据对不上,新贡献不够,文字密得读者抓不住重点。

AI 自审始终给出拒稿,但部分外部 AI 评审给了接收,原作者最终明确拒稿。图源为论文 Figure 3。
TabPFN 的审稿人指出了一个特别典型的问题。智能体试了几个模型内部信号,效果都不好,于是把结论推成「不存在可用的内部信号」。只看几个失败例子,就给整个可能性空间判了死刑。
程序里一次测试通过,不能证明没有边界条件。研究里几个实验失败,也不能证明方向本身不存在。
可智能体没看见这条缝。
第一个短板就藏在这里,它不知道什么证据才够得上高质量研究。
这两轮 agent 最初提出的假设其实不差。原论文作者承认,有些方向和他们自己早期想过的很像。问题出在下一步。智能体用小规模、人工挑选或合成的数据快速验证,一旦结果不好,就过早收缩结论。
它会做实验,却没有一把校准过的尺子。
更麻烦的是,审稿器已经提前把问题说出来了。
研究团队要求智能体反复调用自审子 agent 和外部 AI 审稿工具。几十轮反馈里,自审没有一次给出 Accept。很多批评和最终人类审稿意见高度重合,数据太弱,贡献不足,论证跳步,写作太绕。
检测器工作正常。
修复器没跟上。
智能体收到核心差评后,最常见的动作不是重做研究设计,而是给原结论加限定词,把论点说得更保守,再补几组稳健性实验。随着一个个假设被否定,论文越做越完整,问题却越做越小。
一位原作者的评价很扎心,智能体每丢掉一个假设,研究方向就变得更窄、更没意思。
这一下把 agent 系统里常见的误区照得很清楚。多装一个 reviewer,不等于系统有了判断力。reviewer 只能发告警,真正重要的是告警能不能改变路线。
如果审稿器连续三次说同一个核心问题,而执行 agent 只是继续润色,那不叫反思,只叫自动化地拖延。
第二个短板更像工程里的沉没成本。
智能体会局部回退。实验跑坏了会换参数,数据有问题会加检查,结论不稳会补 robustness test。这些动作都很熟练。
但它不会项目级重启。
TabPFN 那轮里,agent 在前 14 小时依次否定了 6 条路线。此时距离原定截止还有约 110 小时,它却再也没有从总体上换过解法。脚手架明明允许它拉起一个干净上下文的子 agent,从头探索新路线,它平时也经常调子 agent 干别的活,只是从没把这张牌用在推倒重来上。
怎么说呢,这很像一个 CI 绿了、需求却做错的项目。每个提交都比上一个更稳定,但仓库正在稳定地走向错误方向。
研究者真正难替代的动作,可能不是想到第一个好点子,而是在所有人都投入了时间之后,仍敢说这条路不值了,我们重来。
第三个短板是时间感和资源感。
两个主实验结束时,3000 美元 API 预算都没花到一半。Personas 用了 1130 美元,TabPFN 用了 1235 美元。有一轮在自家 reviewer 再次给出拒稿后,agent 仍然提前 7 小时宣布项目完成。
不是它查不到预算。时间、token、GPU 三个余额随时可看,研究者也反复提醒它继续用。

两轮智能体都跑到截止附近,却只用了约四成 API 预算,资源曲线与研究进度没有对齐。图源为论文 Figure 1。
它只是没有形成「剩下 7 小时还能做多少事」的真实判断。
很多朋友可能不知道,长时间 agent 的资源管理不是给 prompt 里加一句「充分利用预算」就能解决。模型训练数据来自人类,人类在 7 小时里可能只够改两轮实验,agent 却能读写几百次。它会继承人的时间语言,却没有人的时间体感。
到了 Codex 和 GPT-5.6 Sol Ultra 的复现实验,问题又翻到另一个极端。
同样 3000 美元预算,这一轮两天多就烧光了,离截止还剩将近 100 小时。前期轮换假设花掉了大部分 token,等它终于决定扩大实验,只剩几百美元用来写论文和修改。
一个不肯花,一个一把梭哈。
棒棒的,两种失败都集齐了。
这不是简单的成本优化问题,而是策略问题。预算要和研究阶段绑定。探索期该花多少,验证期留多少,什么时候必须触发一次重新规划,不能只让模型看余额自己悟。
第四个短板更贴近所有长任务 agent 的老毛病,指令漂移。
研究团队明确规定了探索至少持续多久、外部评审多久调用一次、正文和摘要的长度上限。agent 开始时都确认收到,跑了几天后却陆续忘掉。
两篇论文都超出 NeurIPS 的九页正文上限。Personas 的主文一张可视化都没有,人类原论文有 15 张。参考文献数量也明显少于原作者论文。
这些不是模型不知道规则,而是规则在长上下文里慢慢失去重量。
你如果在做多天运行的 coding agent,这个结论很实用。关键约束不能只存在最初的 system prompt,也不能指望 compaction 每次都把它们原样保住。它们得变成外部状态,变成每轮都检查的验收器,最好还能阻止 agent 在不合格时宣布完成。
提醒是软的,门禁才是硬的。
坦率讲,这篇论文也没有把 agent 描成一个只会浪费钱的笨蛋。
研究者检查了原始调用和全部代码,没有发现显著的奖励作弊。智能体没有藏实验、改数据,也没有为了好看捏造正面结果。它反而很认真地把更吸引人的初始结论一个个否掉,最后交出没那么好看的负面发现。
子 agent 有 5 次幻觉或错误转述实验结果,主 agent 按要求复核后全部抓了出来,没有混进最终论文。它甚至给所有结果做了统一复现脚本。
这份科研伦理,比很多营销稿强。
论文的限制也必须摆出来。核心样本只有两篇论文和 5 次运行,原作者审稿不是盲审,可能偏爱自己走过的路线。人类研究团队在原论文上花了远不止六天。主实验用的开放式脚手架还遇到过会丢上下文的 bug。研究团队部分成员本来就不相信近期会出现递归式自我改进,这也可能影响题目选择和解释。
作者把这些都写在完整论文里,还公开了CRUX 项目与复现材料,欢迎外部专家检查。
所以现在下结论说「AI 永远不会做研究」,同样是拿两个例子证明整个空间,正好犯了论文批评 agent 的毛病。
我自己的判断更窄一点。
当前的 agent 已经能把研究工程压缩得很狠。文献、环境、实验、复现、初稿,这些环节会越来越便宜。像 Karpathy 的 autoresearch 那种目标明确、每轮都能自动打分的任务,还会继续飞快进步。
但开放式研究的瓶颈没有跟着消失,它只是从「能不能做」挪到了「该不该做」。
真要把这类 agent 接进团队,我会把人的注意力守在四个地方。选什么问题,什么证据才算过线,什么时候整条路线必须重启,最终结论有没有超过数据能支撑的边界。
至于文献下载、GPU 环境、批量实验、图表、复现脚本,让 agent 多干点。它已经证明这些活儿能接住。
这话听着可能没那么科幻,却对眼下的团队更有用。别急着造一个独立 AI 科学家,先造一个不会把拒稿信当修改意见的研究系统。
六天、数百次实验、两篇完整论文,最后换来两个明确拒稿。
这不是 AI 什么都不会的证据。
它更像一张刚画清楚的分工图,机器负责把路走得更快,人负责判断这条路值不值得继续走。