一项覆盖 340 万人的研究:AI 筛简历,正在系统性地刷掉一些人

小岛AI 2026 / 06 / 24

事情是这样的。

你投了一份简历出去,石沉大海。再投一份,又没了。你换了个公司,换了个岗位,再投,还是没有回音。你大概会觉得,是自己不够好,是市场太冷,是运气差了点。

但有没有一种可能,从头到尾给你判死刑的,根本不是一个个独立的 HR,而是同一个你看不见的算法。它在 A 公司刷了你,又在 B 公司刷了你,在 C 公司还是刷了你,因为这三家公司用的是同一家供应商的同一套模型。你以为你投了三次,其实你只被审判了一次,结果复制粘贴了三份。

斯坦福 HAI 刚发了一份研究,第一次把这件事从「我感觉是这样」变成了「数据上确实是这样」。我看完之后愣了一下,因为这玩意儿的可怕之处,不在某一条结论,而在它把一个我们隐隐担心、但一直没法证实的东西,摆到了台面上。

原文在这里,斯坦福 HAI 的报道,论文主页在这里。我建议你点开看一眼那张流程图,特别干净,干净到让人发凉。

先把背景铺一下。

2026 这一届毕业生,撞上了好多年里最难的就业市场。入门级岗位本来就在收缩,偏偏 AI 又让海投变得前所未有地容易,一个下午能投出去几十份。两头一挤,结果就是现在一个入门岗位收到的申请量,差不多是 2022 年的三倍。供需彻底失衡。

公司这边怎么办?看不过来了。于是 AI 筛选工具就成了标配。研究里给的数字是,90% 的美国雇主在用某种 AI 工具来给求职者排序、打标签。而且关键不在「用了 AI」这四个字,关键在后面半句,大多数公司用的是同样那么几家第三方供应商。

你品一下这个结构。一个算法,背后站着几百上千家公司。

这就是这份研究真正想戳破的东西。研究团队跟踪了 340 万人、400 万份求职申请,投向 150 家雇主、横跨 11 个行业的 1700 个岗位。而这 400 万份申请,全都经过同一家第三方供应商的 AI 工具过了一遍。这是个相当罕见的视角,平时这些招聘 AI 是彻头彻尾的黑箱,求职者看不到,研究者也摸不进去,这次算是难得地把盖子掀开了一条缝。

招聘 AI 的流水线,求职者投递、申请汇总给供应商、AI 模型给出推荐或不推荐、再回流给公司

掀开之后看到了两件事。我一件一件跟你唠。

先说第一件,也是最容易上新闻标题的那件,规模化的偏见。

研究用了一个挺老的法律标尺来量,EEOC 的五分之四规则。这个规则不复杂,意思是如果某个群体被推荐的比率,低于「最受推荐那个群体」的 80%,这个岗位就被判定存在不利影响。这是美国就业法 Title VII 框架下用了几十年的判定方法,不是研究者临时拍脑袋造的。

用这把尺子一量,结果是,26% 的黑人申请者和 15% 的亚裔申请者,投到了 AI 会系统性压低他们族群推荐率的岗位上。

光看百分比可能没体感。研究换算了一下,如果 AI 给黑人和亚裔的推荐率,跟它最青睐的那个群体(通常是白人)拉平,会有多出来整整 4 万份申请,本来该进到下一轮的。4 万份。就这么悄无声息地,没了。

到这里你可能觉得,哦,又一篇讲 AI 偏见的研究,这种我看过不少了。

别急。这份研究真正让我坐直了的,是它讲清楚了一件方法论上的事,一件特别狡猾、特别容易被掩盖的事。

它问了一个问题,偏见到底该怎么量?

你想想看,这家供应商同时给一大堆公司、一大堆岗位做筛选。如果你把它所有的推荐结果全都倒进一个大池子里,当成一个超级巨大的招聘流程来看,会发生什么?答案是,你看不到歧视。数据上干干净净,岁月静好。

但如果你把每个岗位单独拎出来看呢?标准的不利影响评估本来就该这么做。这一拆,大量岗位里的歧视全暴露出来了。

为什么会这样?研究给了个特别好懂的例子。假设这个 AI 经常推荐黑人去仓库岗,却很少推荐黑人去金融岗。这两个模式,方向是反的。你要是把所有岗位平均到一起算,一个偏高、一个偏低,正负一抵消,看上去就像什么事都没发生过。

大盘的平均数,掩盖了岗位一级真实发生的歧视。

我盯着这段看了好一会儿。因为这事儿太眼熟了。

我平时的工作,有相当一部分是给大模型搭运行的脚手架,就是让模型在生产环境里真能干活的那层工程,调度、评测、上下文管理这些。这套活儿里有一条几乎刻进骨子里的经验,平均值是最会骗人的指标。你看一个系统的整体成功率 99%,感觉棒棒的,对吧?可你一旦按用户分群、按请求类型、按时间段拆开看,经常会发现某一类请求的失败率高得吓人,只是它占比小,被大盘的分母给稀释没了。监控面板上那根平滑的绿线,底下可能藏着一整片塌方。

招聘 AI 这件事,骨子里就是一模一样的统计陷阱,只不过塌方的不是请求,是活生生的人的工作机会。一个供应商完全可以理直气壮地说,你看我整体数据没有歧视啊,合规得很。而真相是,他只是找到了一个让歧视在平均数里互相抵消的姿势而已。

好家伙,这一手是真的让我后背发凉。它不是技术做不到公平,它是连「怎么衡量公平」这件事本身,都能被算计。

行,这是第一件事。但说真的,比起偏见,第二件事才是让我觉得这研究值得写一篇的地方。

研究团队管它叫,算法单一文化(algorithmic monoculture)。

这个词第一次出现你可能有点懵,我用大白话解释。生物学里有个概念叫单一栽培,一大片地全种同一个品种的作物,看着高效,但一种病害来了,整片地团灭,因为它们的弱点完全一样,没有任何多样性来当缓冲。

招聘市场现在正在变成这样一块地。

回到开头我说的那个结构,很多很多公司,共用同一家招聘 AI 供应商。研究团队之前在一系列工作里就提出过一个假说,如果大量雇主都依赖同一套算法推荐,那会不会有一些人,被这套算法在所有地方同时拒之门外?

这次他们用真实数据验证了。结论是,会。

具体的数字是这样的。那些向多个岗位投了简历、而这些岗位恰好都被同一家算法供应商筛选的人,相比于「每家公司各自独立做决定」的情况,明显更容易被所有岗位一起拒掉。投了 4 份申请的人里,有 10% 被他们投的每一个地方全部拒绝。

每一个。一个都没漏。

你得明白这件事在统计上有多反常。如果 100 家公司是各自独立判断的,那么一个还不错的候选人,就算在 A 家运气不好被刷了,在 B 家、C 家总有翻盘的机会,这是概率在帮你兜底。海投的全部意义就建立在这个假设上,多投几家,分散风险。

可一旦这些公司背后是同一个算法,独立性就消失了。你不是在投 100 个评委,你是在把同一份答卷,递给同一个评委看了 100 遍。他第一次说不行,后面 99 次还是说不行。你的海投策略,在那一刻彻底失效了。

一排看似各自独立的门,背后却连着同一个隐藏的筛选机关

为了确认这真的是单一文化造成的,而不是这些人本来就不行,研究团队做了个特别漂亮的对照。

他们去翻了此前规模最大的一份招聘研究,NBER 的那份,往 108 家财富 500 强公司投了 83000 份申请,时间段跟这次研究差不多,但那份研究不关心公司有没有用 AI。结果呢,在那批数据里,「被所有公司一起拒绝」的比率,并不比「各公司独立决策」该有的预期更高。

也就是说,在没有被单一算法垄断的那个世界里,海投是真的能分散风险的,概率确实在帮你兜底。系统性的全盘排斥,没有出现。

两份数据一对照,结论就很硬了。市场集中度是关键变量。当一家招聘供应商开始主导某个行业的筛选,候选人被全面排斥的风险就陡然上升。问题不出在「AI 有偏见」这一层,问题出在「同一个 AI 决定了所有人的命运」这一层。

我跟你说,看到这儿我想到的不是招聘,是我们这行天天念叨的另一个词,单点故障。

软件工程里,你最怕的就是某个组件成为单点故障,整个系统的稳定性全押在它一个身上,它一挂,全盘崩。我们花了几十年时间发明各种冗余、多活、降级,就是为了不让任何一个东西变得不可替代。结果在招聘这件关乎无数人生计的事情上,我们却在亲手制造一个巨大的单点。一个算法卡住你,你在整个就业市场里就被卡住了,没有 plan B,没有降级方案,没有第二个评委。

厉害了,我们把工程上最忌讳的东西,搬到了人生最要紧的地方。

研究里有一句话,我觉得是整篇的题眼,我直接给你翻过来。它说 AI 筛选工具同时凑齐了三个本不该在高风险决策里共存的属性,被普遍采用、影响极其重大、而且对公众完全不透明。

你一个个看。被普遍采用,所以它的影响是规模化的。影响重大,因为它决定的是人能不能吃上饭。完全不透明,因为它是黑箱,被刷的人根本不知道自己是怎么被刷的,更没法申诉。

这三个属性,任何一个单独存在都还好。可怕的是它们凑齐了。规模大但透明,至少能监督;不透明但影响小,那也无所谓;影响大但用得少,伤害面有限。偏偏现在是三个一起,又广、又重、又黑。

这才是这份研究真正的分量。它不是在说某个模型训练得不好、数据集有偏,那种问题修一修就行了。它说的是一整套正在成型的社会基础设施,长歪了。

说到这儿,我得稍微拉回来一点,免得你觉得我在贩卖焦虑。

这份研究的作者自己也很克制。他们反复强调,这只是个开始,这项技术的影响还有太多没搞清楚的地方,而且这个领域变化飞快,现在又有一大批基于大语言模型和智能体造出来的新招聘工具冒出来,跟他们研究的那一代已经不太一样了。今天看到的,可能还只是冰山一角。

那研究者觉得最重要的事是什么?不是喊打喊杀,是独立研究本身的价值。

这句听着平平无奇,但我特别认同。你想,这些招聘 AI 是黑箱,供应商没有动力自曝家丑,公司也乐得有个工具帮自己挡掉海量简历还不用担责。在这种局面下,唯一能把盖子掀开的,就是不被任何一方收买的第三方研究。没有这种研究,所谓证据驱动的 AI 政策就是一句空话,你连证据都拿不到,拿什么驱动?

这事儿对我们这些天天跟 AI 系统打交道的人,其实有更直接的提醒。

我们太习惯用聚合指标来评判一个系统好不好了。准确率、召回率、整体满意度,一个数字往那一摆,干净利落。可这份研究等于是当着所有做 AI 的人的面,把聚合指标这块遮羞布给扯了。一个在总量上看起来毫无偏见的系统,拆开来可能每个局部都在悄悄伤人。你要是只盯着大盘那根绿线,你永远发现不了。

所以如果你也在做任何会影响到真人的 AI 系统,无论是筛简历、批贷款、还是给内容打分,我真心建议你把这份研究当个镜子照一照。别问你的系统平均表现怎么样,去问,它在每一个细分群体、每一个具体场景下,分别表现怎么样?那个被平均数掩盖掉的角落里,有没有人正在被你的模型反复地、系统地刷下去,而你浑然不觉?

回到开头那个投了三次都石沉大海的人。

以前我们会安慰他,多投几家,总会有机会的。这句话曾经是对的,因为它背后站着概率,站着独立性,站着这个市场的多样性。可如果有一天,所有的门后面其实是同一个看门人,这句安慰就变成了一个残忍的玩笑。他投得越多,越是在反复确认同一个判决。

是谁来自山川湖海,却囿于一个连自己都看不见的算法。

我不知道这事儿最后会往哪走。监管会不会跟上,供应商会不会被迫开放审计,市场会不会自己长出多样性来。我也搞不清楚。但至少现在,有人把这个黑箱撬开了一道缝,让我们看见了里面的样子。

而看见,永远是改变的第一步。

斯坦福 HAI 原文论文主页