Proxy reliance in large language model decisions is uncalibrated to predictive evidence
本文揭示了大语言模型在决策过程中表现出对代理属性(proxy attributes)的不校准依赖,即往往无法使其证据的使用与事实真相保持一致,并表明基于标准准确率的评估以及简单的人口统计标签变更不足以检测出这些细微的偏见。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代世界中,算法越来越多地被要求对人类做出高风险的决策,从决定谁能获得贷款,到决定哪位住院患者需要优先接受护理。当这些系统使用大型语言模型(一种在海量文本上训练的强大计算机程序)构建时,公平性的问题变得复杂化了。法律通常接受决策者可以使用某些信息,如果这些信息有助于预测良好的结果,例如使用病人的血压来预测其心脏病发作的风险。然而,法律禁止使用仅仅作为受保护特征(如种族或性别)替代指标的信息,即使该信息在统计学上是有用的。这被称为代理歧视(proxy discrimination)。难点在于,单一的数据项——例如一个人的居住社区——既可以是一个合法的医学指标,也可以是种族的一个隐藏信号。目前测试算法是否公平的方法通常依赖于一种简单的检查:如果你在计算机提示词中改变一个人的种族,而决策随之改变,那么该系统就是有偏见的。但这种方法忽略了现实的细微差别。一个理性的决策者应该在获得真正有用的新信息时改变主意,而一个永远不会改变主意的系统,可能是在忽视重要的证据,而不是在体现公平。
大阪大学的研究人员致力于解决这一问题,他们试图超越简单的“是或否”检查,转而采用一种更精确的测量方式,即衡量算法应该在多大程度上依赖某些线索。他们创建了一个模拟世界,在这个世界里,他们掌握了关于每位患者及其结果的精确真相,从而能够计算出对任何给定信息进行依赖的完美程度。在这个受控环境中,他们要求四个不同的大型语言模型充当分诊专家,对模拟患者进行治疗优先级的排序。患者通过数值指标进行描述,其中一些是合法的医学信号,另一些则是与隐藏的受保护属性相关联但并无实际医学价值的“代理”指标。研究人员随后可以将模型的行为与一个数学标准进行比较,即一个完全理性的决策者在拥有相同信息时会如何行动。
研究揭示了模型可获得的证据与其实际利用方式之间存在令人震惊的脱节。当研究人员给模型提供完全没有预测价值的线索时,模型仍然依赖这些线索,将无用的信息视为重要信息。这种情况在所有测试的四个模型中都一致发生,无论其供应商是谁。当线索具有真正的实用价值时,模型并没有根据证据的强度来调整其依赖程度。相反,它们维持在一个较大的正向基准依赖水平上,随着预测价值的增长,这种依赖程度严重无法追踪证据的变化。换句话说,模型并没有在倾听数据,而是在遵循一个僵化的内部剧本,忽略了不断变化的现实情况。这意味着,一个系统可能在某一个特定的测试中表现得公平,但在另一个测试中却存在严重缺陷,仅仅是因为该测试与证据更强或更弱的现实条件不匹配。
研究人员还调查了改变数据字段名称是否能阻止这种行为。当他们用具有社会色彩的术词(如“社区”或“职业”)代替中性医学术语来标记代理线索时,模型确实减少了对这些线索的依赖。这乍看之下像是一种安全特性。然而,研究发现这种抑制作用是脆弱且易被打破的。当研究人员在提示词中加入示例以帮助模型理解任务时(这是现实应用中的常见做法),模型立即开始重新依赖这些社会标签,往往完全忽略了名称带来的保护效应。不过,研究指出,在提供示例的六个案例中有三个案例中,社会标签与中性标签之间的对比依然存在,这表明这种抑制并未被完全消除,而是被显著削弱了。这表明,这些模型的所谓安全性只是对特定措辞的表面反应,而非对公平性的深层、可靠的理解。模型很容易被改变其工作语境的方式所诱导,从而产生不公平的行为。
此外,研究表明,模型的决策准确性并不是衡量其是否公平使用信息的可靠指标。一个模型可以出于正确的原因做出正确的选择,也可以出于错误的原因做出正确的选择,并最终得到相同的得分。在某些情况下,通过增加更多数据点来增加任务难度,反而使模型更加依赖不公平的代理指标;而在其他情况下,则使其依赖程度降低。这种不一致性意味着,仅仅检查模型的准确性并不能告诉我们它是否存在歧视。研究人员发现,模型看到的数据点数量与其如何使用这些数据点之间的关系,完全取决于这些数据点是如何相互连接的,而这是一个在现实医疗数据中变化极大的因素。
最终,这项工作证明了目前的人工智能审计方法不足以应对现实部署的复杂性。研究证明,如果没有一个关于证据为何应当被依赖的已知标准,就无法判断一个模型是在公平行事,还是仅仅在忽略有用的数据。研究结果表明,那些看起来最安全的模型配置——即在简单测试中表现出对偏见最具抵抗力的配置——往往也是在医院或银行中实际表现最不具代表性的。研究结论认为,要真正理解和监管这些系统,我们必须超越简单的偏见检查,开发出能够衡量算法对特定信息的依赖程度是否与其信息的实际价值相匹配的方法。在我们实现这一点之前,我们面临着两种风险:要么是在惩罚理性的系统,要么是更危险地,在信任那些基于对世界脆弱理解而悄悄做出不公平决策的系统。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。