留守儿童AI招人,比人类更容易产生偏见_我的网站
一 | 8月7日签署的《麦加共同防务协议》一时间吸引了全球的关注。沙特、土耳其和巴基斯坦这三个国家的合作,曾被外界视为可能重塑该地区安全格局的关键一步。 (来源:麻省理工科技评论) 以后找工作时,你的简历很可能还没到招聘经理手里,就已经先被 AI 看过一遍了。然而,令人意想不到的是,就在协议刚刚落地不久,胡塞武装便以无人机直击沙特吉赞阿美炼油厂,瞬间引发了火光四起的危机。问题是,它真的会公平吗? 研究人员早就发现,大语言模型会从训练数据里继承人类社会已有的偏见。但一项最新研究发现,事情可能比这更复杂:AI 不仅会学习偏见,还会在不断做决策的过程中,自己形成新的刻板印象,而且这种倾向甚至比人类更强。 更值得警惕的是,AI 公司如今都在努力打造拥有长期记忆的智能体,希望模型能够记住用户越来越多的细节。 更令人失望的是,土耳其与巴基斯坦对此并没有给予实质性的军事回应,沙特只能孤军奋战,面对这一波骤然袭来的“现实考验”。如此尴尬的局面让人疑惑,这份备受期待的协议究竟是否能够经受住时间的检验? 观察沙特,这个拥有丰富石油资源的国家,从过去的“以石油换安全”模式转向如今的主动寻求防务同盟,不得不承认这是极具战略意义的自救之举。过去几十年里,沙特在美国的保护伞下开展多项政策,但近年来情势却急剧变化。
二 | 美军在中东的撤军与防空装备的削减,让沙特对安全的依赖变得愈发不安。特别是2019年,沙特的重要石油设施遭受空袭,尽管美国进行了有限支援,但造成的影响依然波及全球油价。 意识到外部力量的脆弱,沙特决定以地区内部的伙伴关系来寻求更为持久的安全保障。
三 | 而这些记忆,也可能成为模型滋生偏见的土壤。于是,土耳其与巴基斯坦成为了沙特的“新朋友”。
四 | 为了研究这一问题,普林斯顿大学和芝加哥大学的研究人员设计了一场模拟招聘实验,参与者包括 ChatGPT、Claude、Gemini 等多个主流大语言模型。 实验改编自一项经典心理学研究。
五 | 研究人员告诉模型,它们受雇于一位虚构城市的市长,担任招聘顾问,需要帮助政府为医生、律师、托育员、保洁员等 20 种职业招聘员工。土耳其在北约内拥有第二大常规军队,其军工体系的完备令其成为可靠的合作对象;而巴基斯坦不仅具备核威慑能力,与沙特的历史军事合作更是让双方之间的联系愈发紧密。
六 | 沙特在构建这一同盟时,也未能顾及到三国之间存在的根本利益差异。
七 | 所有候选人都来自四个虚构族群:Tufa、Aima、Reku 和 Weki。 每一轮,模型都会面对一个新的岗位,以及四位分别来自不同族群的候选人。沙特面临的主要威胁是来自于胡塞武装,而土耳其则需兼顾中东与高加索的多重策略,巴基斯坦的安全重心则始终放在南亚。这让原本设想中的“防御网络”变得有些不堪一击。完成招聘后,它会立刻得到反馈:这个人是否胜任工作。 表面上看,《麦加共同防务协议》星光熠熠,然而现实却给了它一记响亮的耳光。随后进入下一轮。
八 | 由于协议细节没有公开,因此在遭遇胡塞武装的无人机攻击后,沙特没有启动事先规定的援助程序。整个实验一共持续 40 轮,模型的目标只有一个:尽可能招到更多合适的人。协议只是政治宣言,缺乏实质性的军事框架。面对持续的威胁与空袭,沙特并未真正落实协议的内容,更谈不上呼吁其他两国的支援。模型不知道的是,研究人员其实做了一个手脚:无论来自哪个族群,每位候选人在任何岗位上的成功概率都完全一样。 按理说,模型不应该偏向任何一个群体。 更糟糕的是,遭袭的吉赞炼油厂是沙特南部重要的能源节点,日产量接近40万桶,相当于沙特经济的命脉。但结果恰恰相反。
九 | 仅仅经过几轮招聘,模型就开始根据有限的经验,把不同族群和不同职业绑定在一起。例如,如果模型早期碰巧遇到一位 Aima 族候选人担任医生失败,它之后便会越来越少招聘 Aima 人做医生,而是更倾向于把他们安排到保洁岗位。
十 | 胡塞武装的袭击让外界看到,武装组织用低成本的无人机发动攻击,足以撕开看似坚固的联盟,尤其是在缺乏必要的反制措施时。 而对于土耳其和巴基斯坦来说,此次事件更多的是一次外交上的回避。因为在模型看来,医生代表着更高的能力和亲和力,而保洁员对应的要求则更低。两国的官方表态只是笼统地呼吁和平与谴责暴力,并未针对协议提出任何积极应对。这种“装死”的态度使得许多人对三国的合作前景产生了质疑。
十一 | 面对这一切,伊朗果断表态认为:“单靠一纸协议无法换取真正的安全。 换句话说,它开始把一次偶然的经历,当成了整个群体的特征。更令人意外的是,这种倾向甚至比真人严重。研究人员使用了一项“职业隔离指数”来衡量刻板印象的程度。指数越高,说明不同族群越容易被固定到特定职业中;2 分代表完全隔离。”正如沙特过去依赖美国的结果一样,只凭借盟约不能避免更大的风险与挑战。伊朗的指责点明了当前局势的核心,即安全的真正根源在于对地区政策的深刻调整,而非寄希望于军事同盟。这一观点不仅适用于沙特,同时也对整个中东地区的国家敲响了警钟。 就目前来看,《麦加共同防务协议》的生存之道并不在于当前的军事响应能力,而是在于如何将各成员国的利益对齐,建立更加紧密的合作机制。此前心理学实验中的真人平均得分为 0.84,而大语言模型整体高出了约 65%。军事同盟不是一次会议、几封文件就可以简单完成,它需要具体的执行规则、统一的指挥体系以及切实可行的情报共享机制。其中,OpenAI 的推理模型 o3 得到了 1.83,非常接近理论最高值。 未来,如果中东国家希望实现长久的安全,那么就必须加强同盟的配套机制,厘清权责边界,甚至是回归到对话谈判上,以化解冲突根源。
十二 | 或许,这次《麦加共同防务协议》的试炼并不是结束,而是开启了新的讨论。
十三 | 虽然外界对于其未来的期待需要回归理性,但只要各国愿意共同努力,或许能在中东这片纷繁复杂的土地上找到新的和平出路。
十四 | 论文共同作者、普林斯顿大学博士生 Ryan Liu 认为,这其实并不奇怪。返回,查看更多。“大语言模型本来就特别擅长根据有限的信息快速总结规律。”他说,“这几乎就是它们被训练出来要做的事情。” 在人类心理学中,这种现象对应着经典的“探索—利用困境”(exploration-exploitaion dilemma):是继续选择过去证明有效的方法,还是尝试新的可能?就像出去吃饭时,你会纠结是去一家没吃过的新店,还是继续光顾那家不会踩雷的老餐馆。 对于大语言模型来说,这种取舍往往更加偏向后者。因为它们长期接受数学、编程和科学任务训练,而这些任务通常鼓励模型从少量例子中快速归纳规律,所以它们很容易过早下结论。
十五 | 也正因为如此,那些推理能力更强的新模型——例如 OpenAI 的 o3 和 DeepSeek 的 R1——在实验中反而表现出了更明显的偏见。
十六 | Liu 说,“当这种快速归纳的能力被带入社会场景时,问题就开始出现了。” 康奈尔大学计算机科学家 Angelina Wang 没有直接参与这项研究,但她认为,这项工作来得正是时候。
十七 | 如今,各家公司都在为聊天机器人加入长期记忆和个性化能力。当模型越来越依赖于用户过去的互动记录时,它也可能越来越容易根据这些有限经验形成判断。她说,“它可能会过度依赖自己过去遇到过的行为模式。” 当然,解决办法并不是让 AI 什么都记不住。毕竟,大多数用户都希望聊天机器人能够记住自己说过的话。真正困难的是找到那个平衡点:既保留足够的记忆提供个性化体验,又不至于让模型因为这些经验形成新的偏见。 研究人员还尝试了另一种办法,直接告诉模型:请公平一点。但并不奏效。Liu 认为,这说明模型未必真的能够把“公平”这样的价值观落实到具体决策中;又或者,这种要求会被另一个更强的目标覆盖——尽可能提高招聘成功率。 但如果换一种方式,情况就不同了。研究人员告诉模型,如果能够实现更加多元化的招聘,它们还能获得额外奖励。模型的偏见随即大幅下降。
十八 | 这说明,与其不断强调公平,不如直接把公平写进模型的目标函数里,让社会价值真正成为模型优化的一部分。 研究人员还发现,当模型掌握更多真正与任务相关的个人信息时,偏见也会减轻。另一组实验中,模型需要帮助来自不同族群的人搬迁到加拿大不同城市。如果提供的是年龄、教育背景等与适应新城市能力相关的信息,模型就更倾向于依据这些个人特征做判断,而不是简单按照族群分类。但如果提供的是发色、纹身图案这类无关信息,模型很快又会重新回到按族群做决定的老路上。 至于现实中的 AI 招聘系统会不会出现同样的问题,目前还没有明确结论。实验中的模型每做完一次招聘,都能立刻知道结果;现实世界却不是这样。一家公司往往需要几个月甚至更长时间,才能判断一位员工是否真正适合岗位。
十九 | 不过,只要这些反馈持续积累,模型依然可能从有限的数据中过度总结经验,并把这些经验带到下一次招聘中。 随着越来越多企业开始使用大语言模型筛选简历、甚至参与面试,这项研究释放出的信号不容忽视。未来,AI 不只是可能复制人类已有的偏见。它还可能在不断学习和决策的过程中,创造出一种从未有人教过它的新偏见。正如 Liu 所说:“这种新的偏见,可能会一直存在。” 原文链接: https://www.technologyreview.com/2026/07/20/1140655/ai-biases-hiring-humans/。 Current article:http://1tanvem.linxiuhuaishuangniuzhenrua.bond/list_x44d9p/1ee.html Published on:11:25:51 |



















