LLM 可能比人类更快形成招聘偏见

MIT Technology Review AI··作者 Michelle Kim

关键信息

这项实验改编自一项关于刻板印象形成的心理学研究:每个模型都扮演虚构城市市长的顾问,在 40 轮中为 20 个岗位招聘候选人,候选人来自 Tufa、Aima、Reku 和 Weki 四个虚构族群。按照研究中的隔离评分尺度,人类得分为 0.84,而模型大约高出 65%,其中 OpenAI 的 o3 达到 1.83,接近 2 的上限。

资讯摘要

这篇报道介绍了一项新的研究,显示大语言模型不仅会从训练数据中继承偏见,还可能在经验中自己形成招聘偏见。普林斯顿大学和芝加哥大学的研究人员把 ChatGPT、Claude、Gemini、OpenAI o3 和 DeepSeek R1 放进一个模拟招聘任务,这个任务改编自一项研究刻板印象形成的心理学实验。实验中,每个模型都扮演虚构城市市长的顾问,需要在医生、律师、育儿助理、清洁工等岗位之间为候选人做选择。候选人来自四个虚构族群,模型被要求在 40 轮中尽可能做出更多成功招聘。

模型并不知道所有族群在每种岗位上的成功概率其实完全相同。尽管如此,模型还是会在观察到少量结果后,很快把不同群体分配到不同类型的工作上。文章举例说,如果模型看到某个 Aima 在医生岗位上失败,就可能转而把所有 Aima 都排除在医生之外,甚至开始把他们安排到清洁工岗位。研究者发现,这些模型比原始研究中的人类参与者更容易根据族群进行刻板化分类,而且推理能力更强的新模型偏见反而更明显。

LLM 可能比人类更快形成招聘偏见

资讯正文

下次你申请工作时,AI 可能会先于任何人类查看你的简历。但我们完全有理由质疑,AI 是否会公正地评判你。研究人员早已知道,LLM 会从训练数据中吸收人类偏见。新的研究表明,LLM 也可能从经验中形成自己的偏见——而且比人类更容易对求职者形成刻板印象。随着 AI 公司竞相打造能够记住用户最细微细节的 agentic 模型,它们或许正在为这些模型形成偏见提供“弹药”。

普林斯顿大学和芝加哥大学的研究人员将包括 ChatGPT、Claude 和 Gemini 在内的 LLM 放进一个模拟招聘游戏中;这个游戏改编自一项心理学研究,后者探讨了人类如何形成刻板印象。研究人员告诉每个模型,它被一座虚构城市的市长聘为顾问,然后让它帮助招聘 20 个职位,包括医生、律师、儿童看护助理和清洁工。候选人来自四个虚构族群:Tufa、Aima、Reku 和 Weki。

在每一轮中,都会出现一个新的职位空缺和四名候选人,每个族群各一人。模型雇用某位候选人后,会得知其工作表现是否成功,然后进入下一轮。模型被要求在 40 轮中尽可能多地做出成功雇用。模型并不知道的是,所有候选人在每一种工作中成功的概率都完全相同。

模型很快就开始根据早期观察到的招聘结果,把不同族群的候选人分配到不同工作中。例如,当模型得知一名 Aima 在医生岗位上失败了,而医生被认为需要较高的温暖感和胜任力时,它就不再倾向于把所有 Aima 都雇为医生。相反,它开始把 Aima 雇为清洁工,而模型将清洁工分类为比医生更低的温暖感和胜任力。

在把人群按人口统计群体进行刻板化方面,这些模型甚至比原始研究中的人类参与者更容易这么做。在该研究的“分隔”量表上,2 分意味着每个群体都被完全限制在自己的职业细分领域内,人类参与者得分为 0.84。模型的得分大约高出 65%,其中 OpenAI 的推理模型 o3 得分为 1.83,接近可能的最高值。

普林斯顿大学博士生、该研究合著者 Ryan Liu 表示,这正是因为 LLM “真的非常渴望从有限数据中做出概括”,这项研究已于 7 月以论文形式在首尔举行的 ICML 上发表。“这几乎就是它们优化目标中的很大一部分。”

无论是人还是机器,每个决策者都要面对一个权衡:是坚持过去行之有效的方法,还是尝试可能更有效的新方法——心理学家把这种现象称为“探索—利用困境”。这就像是在一家新餐厅和你一直信赖的老地方之间做选择。

由于 LLM 的训练内容包括数学、编码和科学问题——这些任务奖励的是仅凭少数几个例子就能进行概括——它们可能会过早地形成判断。而同一种帮助 LLM 破解逻辑谜题的本能,也会让它们很快对人贴上刻板标签。

在这项实验中,推理能力更强的新模型,比如 OpenAI 的 o3 和 DeepSeek 的 R1,表现出了更强的偏见。刘说,当 LLM 在社交场景中急于泛化时,“往往就是出问题的时候。”OpenAI 和 Anthropic 均未回应置评请求。

康奈尔大学计算机科学家 Angelina Wang 表示,这一发现在聊天机器人记忆和个性化功能不断增强的当下尤其相关,但她并未参与这项研究。她说,当聊天机器人调用先前的对话历史时,它可能会“过度依赖它以前经历过的同类行为”,从而形成偏见。

不过,仅仅让聊天机器人少记一些内容并不是解决办法,因为用户希望聊天机器人记住他们说过的话。Wang 说:“我们仍在试图弄清楚,什么样的记忆量才刚刚好,既不会太多,也不会太少。”

告诉模型要公平并没有太大改变它的行为。刘说:“要么它无法把这些价值落到行动上,要么这个过程被那种试图优化目标、争取获得最多正确录用结果的倾向所淹没了。”但如果承诺模型在多元化招聘方面还能获得额外奖励,它们的偏见就会大大减弱。因此,诀窍在于设计那种“将理想的社会价值纳入其中,以便让大语言模型以符合社会期望的方式行事”的目标,刘说。

当研究人员向模型提供更多关于个人的信息时,模型也会变得不那么有偏见。在同一研究中的另一项实验里,研究人员让模型将不同族裔群体重新安置到加拿大各城市。当地模型获知与适应新城市能力相关的个人信息,例如年龄和教育程度时,它们就不那么可能按照族裔来隔离人群。但当提供的是无关信息,例如发色和纹身形状时,模型基本又回到了按族裔对人进行分类的做法。

AI 系统在现实世界中会在多大程度上给求职者贴上刻板印象,目前仍是一个未解问题。实验中的模型会立刻知道自己是否成功录用了合适的人选,而现实中筛选简历的模型并不会马上得到成绩单。企业往往要过很长时间才能知道新员工到底好不好。

随着 LLM 通过经验学习来决定谁该被录用、谁该获得贷款,或者谁该被假释,我们真正需要警惕的偏见,可能包括那些从未被任何人教给它们的偏见。刘说:“这些新型偏见——某种程度上,它们始终都存在。”

深度解读

一家初创公司声称,它突破了拖慢 LLM 发展的瓶颈

Subquadratic 现在已分享了关于其新模型的更多细节。但仍有人持怀疑态度。

对 AI 就业恐慌的一次现实检验

关于人工智能对劳动力市场影响,数据究竟说明了什么?答案可能会让你惊讶。

Anthropic 的 Code with Claude 展示了编程的未来——无论你喜不喜欢

随着 Claude Code 之类的工具越来越好,越来越多开发者乐于把编码任务交给它们。软件的构建方式已经发生了根本变化。

保持联系

获取来自的最新更新

MIT Technology Review

来源与参考

  1. 原始链接
  2. AI is more likely than humans to form biases when hiring

收录于 2026-07-21