跑分 90 的搜索 agent,换套题只剩 34 分

小岛AI 2026 / 07 / 18

十个月,30 分涨到 90 分。

BrowseComp,搜索 agent 圈子里的事实标准考卷,2025 年 8 月的时候各家模型还在 30 分上下挣扎,到今年 5 月,榜前那批已经全线站上 90。曲线陡得不像考试成绩,倒像某种资产的 K 线。

然后昨天,美团 LongCat 团队放出一套新题,叫 LoHoSearch,544 道,把 11 个最强模型挨个拉上考场。第一名 GPT-5.5,34.74 分。第二名直接掉到 16 分以下。美团自家的 LongCat-Flash-Thinking 排倒数第三,9.74 分,照发不误,这份诚实我先给个好评。

先交代下背景。BrowseComp 是 OpenAI 去年 4 月发的基准,1266 道题,设计理念是「难找到、易验证」,答案通常是一个具体的人名、地名或专辑名,但要在互联网的犄角旮旯里绕好几道弯才挖得出来。发布那会儿,OpenAI 自家的 Deep Research 也才 51.5%,人类测试员平均 33.3%。

注意这个 33.3%。

一年过去,模型 90 分,人类还是 33 分的水平。论文标题里有个短语我很喜欢,beyond the human difficulty ceiling,人类出题的难度天花板。翻译成人话,人类已经出不出能难住模型的搜索题了。

为什么会这样?论文给的解释挺扎心。这些基准的题都是领域专家手写的,而人出题有个绕不开的毛病,只会挑自己熟悉的实体和关系。熟悉的实体往往名气大、链接多,从任何一个线索出发,几步检索就能摸到。出题人自我感觉绕了十八道弯,模型三轮搜索就定位了。

美团团队把搜索题的难度拆成两个变量。一个是每条线索的候选集有多大,线索越宽泛,满足条件的候选实体越多,agent 要逐个验证排除的对象就越多。另一个是要同时满足几条线索才能锁定唯一答案,约束越多,交叉验证的工作量翻着倍涨。人类标注员对着浏览器出题,脑子里没有全网实体的统计分布,这两个变量都拉不满。

所以他们干脆不让人出题了。

做法有点子牛逼。把全量英文维基百科灌进来建了张知识图谱,762 万个实体,2.65 亿条有向边,每个实体的类型从 Wikidata 取,知名度用入度衡量,也就是有多少页面链向它。然后在这张图上用算法采样出题,专挑冷门实体,专挑候选集大的关系,用程序把两个难度变量同时拉满。

出题流程里有几个设计,我反复看了好几遍。

第一,答案唯一性是图谱层面可证明的。采样出的每道题要满足,去掉任何一条线索,答案就不再唯一,这保证每条线索都必要,没有一句废话。而全部线索交起来,候选集恰好只剩一个实体。图状结构的题还要跑穷举回溯,确认全图找不到第二组满足同样约束的实体。人出的题靠人肉验证答案唯一,这套是拿图算出来的。

第二,每条线索都要过「搜不到」测试。线索由模型从维基页面里提取并刻意模糊化,然后拿去搜索引擎验证,直接一搜就能搜到的,废弃。能被 LLM 不联网直接推理出来的,废弃。多条线索组合起来变简单的,也废弃。

第三,这条最狠。成题之后,让 DeepSeek-V3.2 驱动的搜索 agent 独立做很多遍,凡是多次都能做对的题,扔掉。

你品一下这个流程,题库里最后留下的,全是筛选 agent 反复做不出来的题。相当于出卷老师提前拿模拟考把题库清洗了一遍,考生还怎么玩。

有意思的是,这套自动化流水线的成品质量还不低。75.5% 的题直接通过人工审核,只有 2.2% 因为逻辑问题被废弃。但有个数字我觉得更能说明难度,29.2% 的题连专业标注员都没法完全确证答案唯一,穷尽搜索也找不到第二个答案,但就是不敢打包票。题难到验题的人自己都验不动了。

给你感受下成品长什么样。有道树状结构的题大意是,有一张专辑,它收录了另一张专辑的单曲,后者出自一个选秀节目组建的组合,那节目从 2000 年代初播到 2010 年代中。它还收录了某人写的歌,这人和某个奖项得主同名,该奖从 2000 年起每年颁发,别名里带一个社区服务项目的缩写。它还收录了某位制作人的作品,这人学的学科在历史上分三大经典方法。

答案是 The Best of No Angels,一张德国女团的精选集。

不是哥们,我读题干都要来回三遍才能理清指代关系,agent 得在开放互联网上把这玩意挖出来。

然后就是开头那张成绩单。GPT-5.5 一骑绝尘 34.74%,第二梯队 DeepSeek-V4-Pro、Claude Opus 4.6、Kimi-K2.6 挤在 15% 到 16% 之间,剩下的全在 14% 以下。同一批模型,在 BrowseComp 上可都是 60 到 90 分的选手。考试工具也统一得很朴素,每个模型就发两件家伙,search 负责关键词检索,browse 负责按网址读网页,上下文一律 200K,谁也别想开挂。

LoHoSearch 全场成绩单,数据来自论文 Table 2

细分下去还有一层,图状结构的题只有 8.01% 的正确率,树状的有 11.89%。差别在于图状题的线索之间互相缠绕,有环,没法拆成几个独立的小问题各个击破,必须端着一堆没验证完的假设同时往前推。约束一交叉,难度不是相加,是相乘。

比分数更有信息量的是校准误差那一列。校准误差衡量的是模型自报的信心和实际对错之间的偏差,你说有八成把握,就该十道题对八道。这次全场校准误差从 31% 到 76%,Gemini-3.1-Pro 高达 72。模型不光做不对,还不知道自己做不对,信心满满地交上一个错误答案。做过 agent 产品的朋友知道这有多要命,答错但知道自己心虚,系统可以兜底重试,答错还自信,错误就直接漏到用户面前了。

接下来是整篇论文里我私心最关注的部分,上下文管理实验。我日常的工作就是给大模型搭运行的脚手架,agent 的工具链、调度、上下文这层让模型真正干活的工程,所以看到别人拿这块做消融实验,跟看到自己家门口被架了摄像头似的,凑得特别近。

事情很好理解。做对一道 LoHoSearch 的题,平均要 61 次工具调用,BrowseComp 只要 35 次。每次搜索、每次网页浏览的结果全要塞进上下文,200K 的窗口根本兜不住,中途必须清理。论文测了两种主流清理策略。一种叫 Summary,把已有轨迹压缩成摘要再继续,相当于把查过的资料整理成笔记随身带。另一种叫 Discard-all,把之前所有工具调用记录全扔了,只带着原始问题从头再来。

在 BrowseComp 上,这些策略配合一个提交前的校验模块,能把 DeepSeek-V4-Flash 从 58.84 拉到 72.87,涨 14 个点,非常可观。同一套东西搬到 LoHoSearch 上,从 10.02 涨到 16.82,只剩 6.8 个点。

左边蓝色是 BrowseComp,右边绿色是 LoHoSearch,同一套策略的增益缩水了一半还多

而且你敢信,全扔的 Discard-all 比精心摘要的 Summary 效果好。

我跟你说,这个细节值得做 agent 的人多看一眼。摘要会丢信息,这事大家都有预期。但连「压缩了带上」都跑不过「干脆全扔重开」,说明在这种超长任务里,被压缩过的上下文不光没帮上忙,可能还在误导模型。笔记记得不好,不如不带笔记进考场。

顺着这个再看并行采样那组数。单次作答的 pass@1 只有 9.3%,采 16 次里只要有一次做对就算过的 pass@16,能到 38.3%。能力似乎是在的,只是单条轨迹撞进正确答案的概率太低。而从 16 个答案里挑一个的三种策略里,挑模型自信度最高那个的 best-of-N 拿了 24.6%,明显强过多数投票。难题面前连投票都失灵了,因为大多数答案都是错的,投出来的还是错的。

DeepSeek-V4-Flash 在 LoHoSearch 上的采样实验,重复采样还有很大空间

好,通稿部分到此为止,聊聊这事对做 agent 的人的分量。

如果你在做 deep research 或者搜索类的 agent,不管是自家产品还是接的活,这份卷子等于提前告诉你,演示环境和真实世界之间,隔着 55 个点。用户拿简单事实题试你的产品,很顺,因为那是 BrowseComp 难度,模型已经 90 分了。哪天用户拿一个多约束、冷门实体、需要交叉排除的真实需求来问,比如在某个细分行业里找同时满足五个条件的供应商,那就是 LoHoSearch 难度,成功率直接掉到两位数以下。这不是我吓唬人,是同一批模型在两套题上的实测落差。

上下文管理这层的天花板也被戳破了。之前大家在 BrowseComp 上做实验,随便一个策略都能涨十几个点,显得这问题快被解决了。现在看,一旦任务长度真的拉上去,现有方法集体哑火。这块反而是我觉得最兴奋的地方,窗口平移、摘要压缩这些手段的红利吃完了,接下来拼的是真正的记忆设计,什么该记,什么该忘,什么时候把验证过的中间结论固化下来腾地方。留给工程层的空间还大得很。

还有一层,出题方式本身可能比这套题更重要。人工基准发布一次就冻结了,被模型见过、泄进训练数据只是时间问题,然后大家心照不宣地刷分。图谱生成的基准不一样,难度由参数控制,候选集阈值调大一点,约束数加一条,新一批题就滚出来了,理论上可以跟着模型能力一起长。基准从一次性考卷变成可再生资源,这个思路厉害了,我赌后面会有一串跟进工作。

回到开头那条曲线。十个月从 30 涨到 90,我们默认这是模型在变强。这当然占一大部分,但 LoHoSearch 提醒了另一种可能,题的难度是有天花板的,模型把天花板顶穿之后,分数上涨测量的就不再是能力,而是天花板本身的高度。

跑分是海图,真实海域里,没标进海图的暗礁永远比标了的多。做 agent 的各位,把 34.74 这块礁石的位置记下来,然后继续航行。

论文在 arXiv,题目全量挂在 HuggingFace,可以直接下载下来喂给自家 agent 试试水。真跑出个高分,记得回来吱一声。