← 最新论文
💻 computer science

EQUITRIAGE: A Fairness Audit of Gender Bias in LLM-Based Emergency Department Triage

EQUITRIAGE 研究对近 37.5 万个急诊分诊场景中的五个大型语言模型进行了审计,发现所有模型均表现出性别偏见,其翻转率超过 5%,这表明群体公平性、反事实不变性和校准等公平性指标是截然不同的属性,在临床部署前需针对特定模型进行审计。

原作者: Richard J. Young, Alice M. Matthews

发布于 2026-05-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Richard J. Young, Alice M. Matthews

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下繁忙的急诊室,分诊护士充当守门人。他们的工作是查看患者的症状,决定其就医的紧迫程度,并将患者从“危及生命”到“可以等待”进行分级。这套系统被称为急诊严重指数(ESI)

几十年来,医生们一直知道,人类护士有时会基于性别做出错误判断:患有严重心脏问题的女性,往往比症状完全相同的男性等待时间更长,或获得较不紧急的关注。

现在,医院开始使用**人工智能(大语言模型或 LLM)**来协助护士做出这些决定。这篇论文提出的核心问题是:如果我们用人工智能取代人类护士,人工智能会解决这个问题,还是会加剧性别偏见?

作者们开展了一项名为EQUITRIAGE的研究来探究这一问题。以下是他们如何开展研究以及发现了什么,用通俗易懂的方式解释如下。

实验:“双胞胎”测试

为了公平地测试人工智能,研究人员并没有仅仅让人工智能查看真实患者。相反,他们基于真实医疗记录创建了18,714 个数字“ vignettes"(患者短篇故事)

这就像一本**“选择你自己的冒险”书**,故事情节完全相同,但主角的名字和性别发生了变化。

  • 患者 A:“凯莎,59 岁的黑人女性,患有胸痛和高血压。”
  • 患者 B(双胞胎):“德肖恩,59 岁的黑人男性,患有胸痛和高血压。”

其他一切(症状、生命体征、病史)完全相同。唯一的区别就是性别和名字。

研究人员将这些故事输入五个不同的人工智能模型(来自谷歌、OpenAI、英伟达等公司),并要求它们分配紧迫性分数。他们进行了超过 374,000 次测试,以获得清晰的图景。

发现:人工智能并不完美

研究发现,所有五个人工智能模型都表现出偏见,但它们以三种不同的“性格”表现出来:

  1. “低分分诊”模型(DeepSeek 和 Gemini):
    这些模型表现得像一位怀疑论医生,忽视女性的疼痛。当患者为女性时,即使症状完全相同,人工智能给出的紧迫性分数也低于男性患者。

    • 类比: 想象两个人腿部骨折完全相同。人工智能告诉男性“去队伍最前面”,却告诉女性“在后排等待”。
    • DeepSeek是问题最严重的,它将女性患者视为显著低于男性患者的紧迫程度。
  2. “平衡”模型(GPT-4 和 Mistral):
    这些模型要公平得多。它们给予男性和女性大致相同的分数。它们没有对某一性别表现出强烈的偏好。

  3. “困惑”模型(Nemotron):
    这个模型表现混乱。仅仅因为名字和性别的改变,它改变紧迫性级别的频率几乎高达44%。它并非专门针对女性表现出偏见,而是极其不稳定且不一致。

“魔法棒”测试(我们能修复吗?)

研究人员尝试了四种不同的“提示”(指令),看看能否消除偏见。可以将这些视为与人工智能对话的不同方式:

  • “蒙眼”策略: 他们从故事中删除了患者的姓名、年龄和性别,只保留医疗事实。
    • 结果: 这对某些模型(如谷歌的 Gemini)效果显著,几乎完全消除了偏见。然而,对其他模型(如 DeepSeek)效果不佳。为什么?因为年龄仍然在故事中。人工智能利用患者的年龄作为隐藏线索来推测其性别并产生偏见。当他们同时删除年龄和性别后,偏见才最终消失。
  • “要公平”策略: 他们明确告诉人工智能,“不要让性别影响你的决定”。
    • 结果: 这效果参差不齐。对某些模型有帮助,但对其他模型实际上使情况更糟,导致人工智能更频繁地摇摆不定。似乎告诉人工智能“要公平”有时会让它感到困惑。
  • “逐步思考”策略(思维链): 他们要求人工智能在给出分数之前解释其推理过程。
    • 结果: 这适得其反。人工智能并没有变得更聪明,反而更糟了。它开始给出更低的准确度分数,并且变得有偏见。这就像让一个紧张的学生“解释数学的每一步”,结果他们过度思考并犯了更多错误。

大惊喜:“校准”陷阱

最有趣的发现之一是校准这一概念。

  • 人工智能模型实际上在预测谁会住院方面表现良好。如果它们判定某患者为“高风险”,该患者通常会被收治,无论其是男性还是女性。
  • 然而,它们在双胞胎之间保持一致性方面表现糟糕。它们会给男性贴上“高风险”标签,却给女性贴上“中等风险”标签,尽管两人都最终住院了。

类比: 想象一个天气预报应用,关于下雨的预测准确率高达 90%。但是,如果你询问一名男性,它说“下雨概率 90%",而如果你询问一名女性,且云层情况完全相同,它却说“下雨概率 50%"。从长远来看,该应用在技术上可能是“准确”的,但在当下却是不公平的。

结论

该论文得出结论:不能仅仅因为人工智能很聪明,就假设它是公平的。

  • 不同的人工智能模型在偏见方面具有不同的“性格”。
  • 解决偏见没有放之四海而皆准的解决方案。删除姓名对某些模型有帮助,但对其他模型则无效。
  • 要求人工智能“更深入地思考”(思维链)实际上可能会使临床决策变得更糟。

核心要点: 在医院让人工智能决定谁获得急诊护理之前,必须使用这些“双胞胎”测试对每个特定的人工智能模型进行测试。你不能仅仅相信制造商的言论;你必须亲自审计人工智能,以确保它不会以不同方式对待男性和女性。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →