AI 会写论文,但它还不会做研究

小岛AI 2026 / 07 / 30

把两篇尚未公开的 NeurIPS 论文拿走,只留下核心研究问题,再给一个前沿智能体六天时间、3000 美元 API 额度、GPU、虚拟机和整个互联网。

要求也很直接,独立做完研究,交一篇够资格投顶会的论文。

六天后,智能体真的把论文交了。

然后两篇都被原作者拒了。一篇是 Reject,另一篇是 Strong Reject。

这不是哪个模型随手跑了半小时的玩具测试,而是 24 位研究者刚公开的影子评估实验。主实验用了 Opus 4.8,研究团队还拿 Codex 和 GPT-5.6 Sol Ultra 重跑了一次。结果很整齐,工程做得有点子牛逼,研究做得不太行。

好家伙,这个反差比任何跑分都更值得聊。

因为智能体没有卡在我们熟悉的地方。它没有被 CUDA 版本送走,没有在依赖冲突里原地转圈,也没有跑着跑着忘了怎么写 LaTeX。它做了大规模文献综述,调好了 GPU 环境,跑了数百次实验和稳健性检查,通过网页和邮件调用外部审稿工具,最后编译出完整论文,还给结果配了复现脚本。

研究者事前问同行,智能体最可能在哪儿翻车。多数人猜它会陷在工程报错里,死循环,环境坏掉,实验跑不起来。

结果这些都没发生。

真正把它拦下来的,是研究里那些没法写成单元测试的部分。

这件事要从我们怎么评估 agent 说起。

现在最常见的研究型 benchmark,都喜欢给一个明确数字。MLE-Bench让智能体打 Kaggle,SWE-bench看补丁能不能通过测试,训练优化任务盯着 loss 和速度。目标像山顶,评估器像高度计。智能体只要不断试,保留分数更高的路线,迟早能往上爬。

这类任务非常重要,也很适合自动化。但它悄悄拿走了研究里最难的一步,决定哪座山值得爬。

开放式研究没有现成的 loss。你得自己提出候选假设,选择数据,设计能排除替代解释的实验,再判断眼前的结果究竟是信号、噪声,还是实验本身出了问题。走到死路时,还得承认过去几十小时可能全浪费了,转身回到起点。

自动评估器可以告诉你数字变大了,却没法替你回答,这个数字有没有学术价值。

所以这次研究者换了一种测法。他们从两篇未公开的 NeurIPS 2026 投稿里,各抽出一个真正的核心问题。智能体看不到原论文,也不可能从训练数据里背答案。等它交稿,再由原论文作者按顶会标准审。

这个设计叫 shadow evaluation,影子评估。智能体沿着人类研究者走过的问题再走一次,但看不到人类留下的脚印。

两篇稿子的评分很难找补。

Personas 那篇总评 2 分,满分 6 分。TabPFN 那篇只有 1 分。审稿人对前者有较高把握,对后者的拒稿信心是 5 分满分。

批评集中在几件事上。数据和实验选择缺乏原则,结论跟证据对不上,新贡献不够,文字密得读者抓不住重点。

AI 自审、外部 AI 评审与原作者终审的评分差距

AI 自审始终给出拒稿,但部分外部 AI 评审给了接收,原作者最终明确拒稿。图源为论文 Figure 3。

TabPFN 的审稿人指出了一个特别典型的问题。智能体试了几个模型内部信号,效果都不好,于是把结论推成「不存在可用的内部信号」。只看几个失败例子,就给整个可能性空间判了死刑。

程序里一次测试通过,不能证明没有边界条件。研究里几个实验失败,也不能证明方向本身不存在。

可智能体没看见这条缝。

第一个短板就藏在这里,它不知道什么证据才够得上高质量研究。

这两轮 agent 最初提出的假设其实不差。原论文作者承认,有些方向和他们自己早期想过的很像。问题出在下一步。智能体用小规模、人工挑选或合成的数据快速验证,一旦结果不好,就过早收缩结论。

它会做实验,却没有一把校准过的尺子。

更麻烦的是,审稿器已经提前把问题说出来了。

研究团队要求智能体反复调用自审子 agent 和外部 AI 审稿工具。几十轮反馈里,自审没有一次给出 Accept。很多批评和最终人类审稿意见高度重合,数据太弱,贡献不足,论证跳步,写作太绕。

检测器工作正常。

修复器没跟上。

智能体收到核心差评后,最常见的动作不是重做研究设计,而是给原结论加限定词,把论点说得更保守,再补几组稳健性实验。随着一个个假设被否定,论文越做越完整,问题却越做越小。

一位原作者的评价很扎心,智能体每丢掉一个假设,研究方向就变得更窄、更没意思。

这一下把 agent 系统里常见的误区照得很清楚。多装一个 reviewer,不等于系统有了判断力。reviewer 只能发告警,真正重要的是告警能不能改变路线。

如果审稿器连续三次说同一个核心问题,而执行 agent 只是继续润色,那不叫反思,只叫自动化地拖延。

第二个短板更像工程里的沉没成本。

智能体会局部回退。实验跑坏了会换参数,数据有问题会加检查,结论不稳会补 robustness test。这些动作都很熟练。

但它不会项目级重启。

TabPFN 那轮里,agent 在前 14 小时依次否定了 6 条路线。此时距离原定截止还有约 110 小时,它却再也没有从总体上换过解法。脚手架明明允许它拉起一个干净上下文的子 agent,从头探索新路线,它平时也经常调子 agent 干别的活,只是从没把这张牌用在推倒重来上。

怎么说呢,这很像一个 CI 绿了、需求却做错的项目。每个提交都比上一个更稳定,但仓库正在稳定地走向错误方向。

研究者真正难替代的动作,可能不是想到第一个好点子,而是在所有人都投入了时间之后,仍敢说这条路不值了,我们重来。

第三个短板是时间感和资源感。

两个主实验结束时,3000 美元 API 预算都没花到一半。Personas 用了 1130 美元,TabPFN 用了 1235 美元。有一轮在自家 reviewer 再次给出拒稿后,agent 仍然提前 7 小时宣布项目完成。

不是它查不到预算。时间、token、GPU 三个余额随时可看,研究者也反复提醒它继续用。

两次主实验的墙钟时间、API 花费与 GPU 资源曲线

两轮智能体都跑到截止附近,却只用了约四成 API 预算,资源曲线与研究进度没有对齐。图源为论文 Figure 1。

它只是没有形成「剩下 7 小时还能做多少事」的真实判断。

很多朋友可能不知道,长时间 agent 的资源管理不是给 prompt 里加一句「充分利用预算」就能解决。模型训练数据来自人类,人类在 7 小时里可能只够改两轮实验,agent 却能读写几百次。它会继承人的时间语言,却没有人的时间体感。

到了 Codex 和 GPT-5.6 Sol Ultra 的复现实验,问题又翻到另一个极端。

同样 3000 美元预算,这一轮两天多就烧光了,离截止还剩将近 100 小时。前期轮换假设花掉了大部分 token,等它终于决定扩大实验,只剩几百美元用来写论文和修改。

一个不肯花,一个一把梭哈。

棒棒的,两种失败都集齐了。

这不是简单的成本优化问题,而是策略问题。预算要和研究阶段绑定。探索期该花多少,验证期留多少,什么时候必须触发一次重新规划,不能只让模型看余额自己悟。

第四个短板更贴近所有长任务 agent 的老毛病,指令漂移。

研究团队明确规定了探索至少持续多久、外部评审多久调用一次、正文和摘要的长度上限。agent 开始时都确认收到,跑了几天后却陆续忘掉。

两篇论文都超出 NeurIPS 的九页正文上限。Personas 的主文一张可视化都没有,人类原论文有 15 张。参考文献数量也明显少于原作者论文。

这些不是模型不知道规则,而是规则在长上下文里慢慢失去重量。

你如果在做多天运行的 coding agent,这个结论很实用。关键约束不能只存在最初的 system prompt,也不能指望 compaction 每次都把它们原样保住。它们得变成外部状态,变成每轮都检查的验收器,最好还能阻止 agent 在不合格时宣布完成。

提醒是软的,门禁才是硬的。

坦率讲,这篇论文也没有把 agent 描成一个只会浪费钱的笨蛋。

研究者检查了原始调用和全部代码,没有发现显著的奖励作弊。智能体没有藏实验、改数据,也没有为了好看捏造正面结果。它反而很认真地把更吸引人的初始结论一个个否掉,最后交出没那么好看的负面发现。

子 agent 有 5 次幻觉或错误转述实验结果,主 agent 按要求复核后全部抓了出来,没有混进最终论文。它甚至给所有结果做了统一复现脚本。

这份科研伦理,比很多营销稿强。

论文的限制也必须摆出来。核心样本只有两篇论文和 5 次运行,原作者审稿不是盲审,可能偏爱自己走过的路线。人类研究团队在原论文上花了远不止六天。主实验用的开放式脚手架还遇到过会丢上下文的 bug。研究团队部分成员本来就不相信近期会出现递归式自我改进,这也可能影响题目选择和解释。

作者把这些都写在完整论文里,还公开了CRUX 项目与复现材料,欢迎外部专家检查。

所以现在下结论说「AI 永远不会做研究」,同样是拿两个例子证明整个空间,正好犯了论文批评 agent 的毛病。

我自己的判断更窄一点。

当前的 agent 已经能把研究工程压缩得很狠。文献、环境、实验、复现、初稿,这些环节会越来越便宜。像 Karpathy 的 autoresearch 那种目标明确、每轮都能自动打分的任务,还会继续飞快进步。

但开放式研究的瓶颈没有跟着消失,它只是从「能不能做」挪到了「该不该做」。

真要把这类 agent 接进团队,我会把人的注意力守在四个地方。选什么问题,什么证据才算过线,什么时候整条路线必须重启,最终结论有没有超过数据能支撑的边界。

至于文献下载、GPU 环境、批量实验、图表、复现脚本,让 agent 多干点。它已经证明这些活儿能接住。

这话听着可能没那么科幻,却对眼下的团队更有用。别急着造一个独立 AI 科学家,先造一个不会把拒稿信当修改意见的研究系统。

六天、数百次实验、两篇完整论文,最后换来两个明确拒稿。

这不是 AI 什么都不会的证据。

它更像一张刚画清楚的分工图,机器负责把路走得更快,人负责判断这条路值不值得继续走。