A Computational Audit of Demographic Association Encoding in ClinicalBERT Language Predictions
本文对 ClinicalBERT 进行了一项计算审计,揭示了该模型中的表示偏差主要通过内部对人口统计学关联的放大而非仅仅是对训练数据的简单继承来运作,这可以通过模型预测与不同种族和性别类别下的经验语料库频率之间的系统性偏差得到证实。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一位名叫 ClinicalBERT 的高水平医学实习生。这位实习生并非通过教科书或真实患者学习,而是通过阅读数百万页的旧医院病历(具体来自 MIMIC-III 数据库)来学习医生的写作方式和思维方式。本研究的目标是检查这位实习生是否从这些笔记中习得了任何不良习惯或不公平的刻板印象。
作者 Kehinde Temitayo Soetan 扮演着一名数字侦探的角色,进行审计。他们并不是要求实习生进行诊断;相反,他们正在玩一场“填空游戏”,以观察当提到不同类型的患者时,实习生会预期看到哪些词汇。
以下是这项调查的工作原理,通过简单的概念进行分解:
1. “填空”测试
研究人员从医院笔记中提取了 98 个真实的句子,并在每个句子中隐藏了一个特定的词。
- 设置: 他们取了一个句子,如:“[人口统计特征] 患者在护士试图移动他们时变得 [掩码/隐藏词]。”
- 变量: 他们将人口统计特征的位置替换为不同的身份:“白人男性”、“黑人男性”、“黑人女性”、“拉丁裔女性”等。
- 问题: 当模型看到“黑人女性患者”时,它是否会认为隐藏的词是“烦躁”、“困惑”或“拒绝”,相比于看到“白人男性患者”时的情况?
2. 两种主要的工具
侦探使用了两把不同的放大镜来寻找偏见:
- “行为与态度”透镜 (LPBA): 这用于检查描述患者行为(如烦躁或困惑)或他们对医生态度(如拒绝或配合)的词汇。
- “谁在掌控?”透镜 (MLM): 这用于检查显示谁在做决策的词汇。患者是请求了某事(主动)?是拒绝了某事(主动)?还是仅仅表现出某种状态(被动)?
3. 大惊喜:模型正在“放大”偏见
通常,当我们担心 AI 偏见时,我们认为它只是在复制训练数据中的内容。如果训练数据有 10% 的偏见,我们预期 AI 也会有 10% 的偏见。
这项研究发现了不同的情况。
研究人员将 AI 的猜测与训练笔记中实际的词频进行了对比。
- 发现: 在 65.6% 的 AI 显示出强烈偏见的案例中,偏见的方向与实际数据的方向相反。
- 类比: 想象一个图书馆,其中关于“黑人患者”的书籍使用“烦躁”一词的频率与关于“白人患者”的书籍一样高。然而,当 AI 被要求为黑人患者预测下一个词时,它突然认为“烦躁”出现的可能性比实际情况要高得多。
- 结论: AI 不仅仅是在重复图书馆的历史;它是在发明并夸大那些甚至不存在于原始资料中的刻板印象。这就像一个学生在读完一本历史书后,开始讲述比书本本身更具戏剧性和偏见的故事。
4. “放大”现象的具体实例
论文强调了一些非常具体且令人不安的模式:
- “黑人患者”悖论:
- 在数据中: 在真实的记录中,黑人患者使用“拒绝”和“请求”这类词汇的频率实际上比白人患者更高。
- 在 AI 中: 模型预测黑人患者更不太可能拒绝或请求事物。它有效地抹杀了他们的声音和自主权,使他们在记录中显得更加被动。
- “黑人女性”的双重打击:
- 当研究人员专门观察黑人女性时,AI 使她们看起来更不太可能成为主动的决策者(既不配合也不抵抗),并且更像是医疗护理的被动对象。这是一种只有在同时观察种族和性别时才会出现的特定偏见,而不仅仅是看种族本身。
- “烦躁”的切换:
- AI 较不容易认为黑人患者是“烦躁”的(尽管数据显示他们同样容易出现这种情况),但它却更倾向于认为拉丁裔或亚洲男性患者是“烦躁”的。这表明 AI 不仅仅是泛泛地“种族歧视”;它正针对不同的群体应用着非常具体的、不同的刻板印象。
5. 这意味着什么(根据论文)
论文得出结论,仅仅通过“清理数据”(重新平衡训练笔记)来解决这个问题可能行不通。
- 隐喻: 如果问题只是镜子脏了,那么擦干净镜子就能修复反射出的像。但本文表明,问题在于玻璃本身。AI 在其“大脑”内部构建了一个结构,会自动扭曲图像,无论它看到的是什么。
- 核心观点: 偏见是模型生成的,而不只是数据继承的。AI 正在主动创造新的、不公平的关联,这些关联超出了它所学到的内容。
总结
这篇论文是对一种特定类型医疗 AI 的警告标签。它表明,即使是在真实的医院记录上进行训练,AI 也会形成一种“人格”,从而对患者产生不公平的刻板印象——具体表现为使黑人患者看起来比记录中显示的更缺乏主动性,并对拉丁裔和亚洲患者应用不同的负面刻板印象。AI 不仅仅是在重复过去;它正在放大其中的最坏部分。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。