← 最新论文
💻 computer science

Auditing Sex/Gender Disparities in Emergency Triage with LLM-based Paired Comparisons

本文介绍了一种基于大语言模型(LLM)的配对比较方法,用于审计急诊分诊记录中的性别差异,结果显示,当临床表现完全一致时,被标记为女性的情况略微更有可能获得较低的严重程度评分,这一发现验证了该方法作为一种生成偏见假设的可扩展工具的有效性,而非旨在证实直接的临床分诊不足。

原作者: Ariel Guerra-Adames, Marta Avalos-Fernandez, Océane Dorémus, Leo Anthony Celi, Cédric Gil-Jardiné, Emmanuel Lagarde

发布于 2026-08-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Ariel Guerra-Adames, Marta Avalos-Fernandez, Océane Dorémus, Leo Anthony Celi, Cédric Gil-Jardiné, Emmanuel Lagarde

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一名正在试图破解谜团的侦探,但你寻找的不是指纹,而是隐藏在人们决策方式中的隐形偏见。这篇论文存在于人工智能(AI)医疗保健的世界中,特别关注我们如何利用智能计算机程序来检查医生和护士对待患者是否公平。其核心理念依赖于一个被称为**“反事实”(counterfactual)**的概念,这只是一个高级说法,本质上是在问:“如果情况稍有不同,会发生什么?”在这种情况下,问题是:“如果这位患者的性别不同,但拥有完全相同的症状,他们的治疗程度会发生变化吗?”我们之所以关心这个问题,是因为在急诊室里,分秒必争。如果一名患者因为其身份而非病情严重程度而被排在队伍后面,这可能是非常危险的。科学家们长期以来一直怀疑性别可能在这些转瞬即逝的决策中扮演着隐秘的角色,但由于我们无法倒流时间并询问护士:“如果这是个男人会怎样?”所以这很难被证实。

这项研究使用了一种新型的 AI 工具,称为大语言模型(LLM),来充当一个“偏见之镜”。把这个 LLM 想象成一个超级聪明的机器人,它阅读了数百万份医疗记录,并学会了模仿人类护士如何决定患者的紧急程度。研究人员并不是为了用这个机器人取代医生,而是为了让它“化身为”医生片刻,以便进行测试。他们从法国的一家医院和美国的一个数据库中提取了超过 14 万条真实的急诊室故事。然后,他们利用 AI 创建了这些故事的“孪生版本”。对于每一个关于女性的故事,AI 都会写出一个新的版本,其中患者变成了男性,但症状、疼痛和病史都保持完全一致——就像在保持内部人员完全相同的情况下,把一件红衬衫换成蓝衬衫一样。他们对“男性变女性”的情况也进行了同样的操作。

研究结果就像是在一面完美光滑的镜子上发现了一道细微且持续存在的裂缝。研究发现,当 AI 查看这些“性别交换”后的孪生版本时,它倾向于给女性版本打出稍低的紧急程度评分。用通俗的话说,机器人的想法是:“这个人没那么严重,因为她是个女性”,尽管症状是完全一样的。数字虽然很小但很明确:在法国的数据中,女性呈现形式比男性版本更有可能获得较低的严重程度评分,比例约为 1.1%。在美国的数据中,这一差距约为 2.2%。这就像是你和你孪生兄弟都折断了手臂,而机器人分诊护士却仅仅因为他是男孩,就决定让你哥哥更早看医生。

研究人员非常谨慎地检查了这究竟是机器人的大脑出了故障,还是它实际上反映了真实数据中的某种情况。他们尝试了两件事:首先,他们检查了机器人是否只是在“幻觉”(编造事实);其次,他们检查了这种偏见是来自机器人的通用训练,还是来自特定的医疗数据。他们发现,当他们在教导机器人之前,将数据中所有的性别词汇和数字全部清除后,偏见消失了。这表明机器人并不是在凭空捏造差异,而是忠实地复制了它在真实医疗记录中看到的模式。有趣的是,当护士和患者性别相同时(例如,女性护士治疗女性患者),这种偏见似乎最为明显,这表明这些模式是复杂且具有人性特征的,而非随机错误。

然而,作者非常小心,没有过度大惊小怪。他们强调,这些是微小的、文档层面的效应。机器人观察的是书面记录,而不是站在护士面前的真实患者。这项研究证明了书面记录中确实包含这些带有性别色彩的模式,但它并没有证明每一位患者在床边接受的治疗实际上都受到了不公平对待。作者称这是一个“可行性研究”——即证明我们可以利用 AI 来发现这些隐藏的信号。他们指出,如果这些书面记录中的微小差异确实转化到了现实生活中,这意味着每年在法国可能会有数千名女性面临医疗延误。但在人类专家重新核查这些特定案例之前,我们无法确定到底造成了多少实际伤害。主要的启示是,我们现在拥有了一个强大且可扩展的放大镜,用来寻找这些隐形的偏见,而且我们知道它们就在那里,等待着被修复。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →