← 最新论文
💻 computer science

Language Models Reproduce Human Reductionist Bias and Decision Inconsistency in Neurodevelopmental Disorders Assessment

这项研究表明,尽管大语言模型表现出比人类专家更高的智力谦逊,但它们仍然在神经发育障碍评估中重现了人类决策的不一致性以及一种还原论偏见——即优先考虑生物生存而非社会需求——这凸显了在处理高风险心理健康决策时,批判性评估人工智能所运作的概念框架的必要性。

原作者: Maciej Wodziński, Joanna Wodzińska, Kacper Dudzic, Marcin Moskalewicz

发布于 2026-08-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Maciej Wodziński, Joanna Wodzińska, Kacper Dudzic, Marcin Moskalewicz

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在复杂的心理健康护理领域,医生和心理学家经常面临一项艰巨的任务:判断一个人的状况是否严重到足以获得政府支持。这不仅仅是关于诊断一种疾病,更是关于评判一个人管理自己生活的能力。在许多地方,这一判断决定了一个家庭是否能获得护理资金、专门的住房,或是有权让父母留在家中提供帮助。这一决策取决于一个具体的问题:这个人可以独立生活,还是需要针对其基本需求提供持续帮助?对于患有自闭症或注意力缺陷多动障碍等神经发育状况的人来说,答案很少是简单的。他们的挣扎在医生的诊室里可能并不明显,但在现实世界中却可能是压倒性的。由于这些决定承载着如此巨大的分量,人们越来越希望人工智能能够帮助使这些决策更加公平和一致。大型语言模型——即那些能够进行写作和推理的强大计算机程序——正在接受测试,以观察它们是否能充当公正的裁判。但在我们信任它们处理这些高风险选择之前,必须了解它们是如何看待世界的。它们对人类需求的理解是否与人类一致,还是会忽略掉那些构成独立生活基础的微妙社会部分?

波兰的一个研究小组决定通过让人类专家和人工智能接受一系列严格的试验来测试这一点。他们收集了三十五名人类专业人士,包括十八名医生和十七名心理学家,这些人定期在残疾评估委员会工作。这些委员会负责决定谁能获得支持。为了公平地进行比较,研究人员还选择了来自领先科技公司的七种不同的大型语言模型。目标是观察机器是否会犯与人类相同的错误,或者是否会带来一种新型的偏见。研究人员设计了一项研究,主要观察三个方面:决策者是否会被信息的顺序或误导性的照片所迷惑,他们在对自己知识的掌握上有多谦逊,以及最重要的一点,他们如何定义“基本生活需求”这个词。

实验以一系列虚构的案例研究开始。人类专家和计算机模型被要求阅读关于各种状况的人物的描述,然后回答两个问题。首先,他们必须评估该个体的功能水平。其次,他们必须决定该个体是否需要持续的护理或协助才能独立生活。为了测试决策者是否容易受到无关细节的影响,研究人员玩了一些小把脱。在某些案例中,他们将关于一个人挣扎的所有负面信息放在故事的最开头,希望读者会对这些糟糕的第一印象产生刻板印象。在其他案例中,他们将一张看起来忧伤或痛苦的照片附在一则原本与使用中性照片时完全相同的报道上。他们想看看看到一张忧伤的面孔是否会促使专家给予更多的支持,即使文本内容显示该人表现良好。

这些“小把戏”的结果在两组之间表现出了惊人的连贯性。无论是人类专家还是人工智能模型,都没有因为文本顺序或照片中的情绪而表现出显著的决策变化。两组似乎都忽略了这些干扰因素,转而关注案例的核心事实。这是一种宽慰,表明模型不容易被可能使人类分心的视觉或文本线索所误导。然而,当研究人员进行更深入的观察时,发现了另一种问题。他们发现,无论是人类还是机器,在逻辑上都不够一致。一个人可能被评定为具有“显著受损”的功能水平,但同一个人却可能无法获得所需的支持。相反,一个被评定为“平均”功能水平的人可能仍然会获得帮助。功能水平的评定并不能可靠地预测是否会获得支持。这种不一致性在人类医生和计算机模型中都存在,这表明从描述问题到提供解决方案的过程是一个混乱且具有人类特征的过程,而机器也继承了这一点。

研究中最具启发性的部分在于,研究人员要求参与者解释他们的思考过程。他们要求人类和机器定义“基本生活需求”究竟意味着什么。在这里,出现了一个明显的分歧。人类心理学家倾向于持有更广泛的观点。他们将情感福祉、沟通能力和社会联系视为基本生活不可或缺的部分。如果一个人无法与他人交流或理解社交暗示,心理学家认为这就是未能满足基本需求。然而,人类医生则持有更狭隘的观点。他们几乎完全专注于生理生存:进食、穿衣、行走和如厕的能力。人工智能模型令人惊讶地站在了医生这一边。它们几乎完全根据生物生存来定义基本需求。除非直接关系到身体安全,否则它们很少提及沟通或社交互动。

这种定义的差异直接影响了最终的决策。因为心理学家将社交和沟通方面的挣扎纳入了“基本需求”的定义,所以他们更有可能向虚构的患者提供支持。而医生和人工智能模型坚持严格的生物清单,授予支持的频率较低。尽管模型声称对自己的知识非常谦逊——在智力谦逊度测试中得分高于人类医生——但这种谦逊并没有让它们的决策变得更一致或更符合人类专家的标准。事实上,模型的高分谦逊度似乎只是一种表面特征,一种无法转化为对人类复杂性深度理解的表达方式。机器愿意承认自己可能会出错,但它们仍然在一种狭隘的医学框架下运作,忽视了人们在社交层面的现实。

研究结论指出,虽然人工智能可能擅长忽略像忧伤照片或混乱句子顺序这类简单的陷阱,但它尚未准备好在这些敏感领域取代人类判断。这些模型正在复制一种还原论式的人类生活观,即过度重视身体功能的独立,而忽视了社交和沟通的连接。通过仅关注身体的功能,机器面临着拒绝为那些最大的挣扎在于互动与理解层面的人提供支持的风险。研究人员建议,为了使人工智能在心理健康和残疾评估领域真正发挥作用,必须教会它去观察一个完整的人,而不仅仅是一个生物机器。在技术能够理解作为一个人类生活所承载的全部重量之前,依赖它做出这些决定,可能只会强化那些长期以来使人类专家工作复杂化的狭隘视角。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →