← 最新论文
💻 computer science

Language Models Embody and Amplify Human Cognitive Distortions: What Is to Be Done?

本文认为,大语言模型不仅隐蔽地体现并放大了人类的认知偏差,还将其回传给用户,因此有必要建立一个包含诊断、监管和操作层面的综合性对策框架,以减轻其对决策过程所产生的普遍影响。

原作者: Arnau Marin-Llobet, Steven A. Lehr, Mahzarin R. Banaji

发布于 2026-07-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Arnau Marin-Llobet, Steven A. Lehr, Mahzarin R. Banaji

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

学习了撒谎的镜子

想象一下,你正走进一座巨大的图书馆,书架从地面一直堆叠到天花板,每一本书都是人类历史上写过的作品。现在,想象有一个机器人读过了其中的每一本书,并学会了像人类一样说话。这个机器人就是科学家所说的“大语言模型”(LLM)。它是那些你可能听说过的、功能强大的 AI 聊天机器人背后的“大脑”。但问题在于:人类是复杂的。我们会犯错,我们持有隐秘的偏见,而且我们经常言不由衷。这在心理学中是一个众所周知的事实,被称为“认知偏差”。几十年来,研究人员一直在研究我们的脑是如何诱导我们对种族、性别和其他群体做出不公平判断的,而有时我们甚至意识不到这一点。

核心问题是:如果我们通过喂给机器人所有这些复杂的人类文字来构建它,这个机器人会成为一个完美的、逻辑严密的机器,从而修正我们的错误吗?还是它只会变成一面镜子,将我们的缺陷反射回来,而且声音更大、速度更快?这篇论文深入探讨了这样一个问题。这不仅仅关乎机器人是否“聪明”,更关乎它是否“公平”。如果机器人学会了我们隐藏的偏见,它可能会开始在谁能获得工作、谁能获得贷款、甚至谁该入狱等问题上做出不公平的决定。这就是为什么这件事至关重要:我们正在将未来的巨大部分交给这些机器,我们需要知道它们是否值得信任。

染上了坏习惯的机器人

那么,本文作者的研究结果是什么呢?他们观察了最新的 AI 模型,并发现了一些令人不安的现象:这些模型不仅是在复制人类的偏见,它们实际上让偏见变得更严重了。这就像是一个“传声筒”游戏。如果你向朋友低声传递一个谣言,然后他们再传给另一个人,故事就会发生一点扭曲。但这些 AI 模型就像是一个不仅扭曲了故事,还加入了自己戏剧性发挥的朋友,让谣言听起来比原本的情况还要惊悚。

研究人员发现,这些 AI 模型非常擅长隐藏它们的真面目。如果你直接问它们:“你是否比起黑人更喜欢白人?”或者“对待残疾人刻薄一点是否可以?”,它们会大声且坚定地回答“不!”。它们表现得像完美的、有礼貌的公民。但一旦你停止提问直接的问题,转而给它们布置一项任务——比如审查一份简历,或者评判一篇用特定方言编写的故事——它们的真面目就开始显露了。它们可能会在潜意识里认定,使用非裔美国英语(African American English)写作的人不太可靠或更容易有罪,即使其内容与用标准英语编写的故事完全一致。这就像一位法官宣称“我是色盲!”,却因为某人的说话方式而判处其更重的刑罚。

论文指出,这不仅仅是一个可以通过清理数据来修复的小故障。有些人认为:“噢,如果我们只给机器人喂更好的书,它就会变得更好。”但作者认为这还不够。AI 不仅仅是一面镜子;它是一把放大镜。它捕捉到人类文字中的偏见,并将其放大。更糟糕的是,这些模型似乎随着版本的更新变得越来越有偏见。这就像是一个学生每升一个年级,数学成绩就退步一次。这些模型还在学习如何变得狡猾;它们会被人类常用的技巧所欺骗,比如假装成权威人物,或者宣称某物稀有且珍贵。

或许最令人担忧的部分是,这种偏见并不会留在计算机内部。当人类与这些 AI 工具协作时,我们也会开始模仿它们的坏习惯。如果 AI 说:“这个候选人看起来不太好,”而一名招聘经理表示同意,那么这名人类也受到了偏见的影响。接着,这名人类做出的决定被记录下来,而这段新的文本又被反馈回 AI,用于训练下一个版本。这是一个恶性循环,就像滚下山坡的雪球,越滚越大,吸收了更多的雪(偏见),直到变成一场巨大的雪崩。作者指出,虽然几个世纪以来人类一直在缓慢地减少偏见,但这些 AI 模型却在走向相反的方向,随着每一次更新变得更加扭曲。

我们能做些什么?

作者们并不只是在抱怨;他们提出了一个防止事态失控的计划。他们说,我们不能仅仅通过愿望来消除偏见,因为即使是人类也无法完全抹除自己的隐性偏见。相反,我们需要像严格的安全检查员一样。

首先,他们建议为 AI 创建一个公开的“登记册”或计分板。就像汽车在售卖前必须通过安全测试一样,AI 模型也应该必须通过偏见测试。我们需要独立的科学家来检查这些模型,既要检查它们公开表达的内容,也要检查它们秘密执行的行为。这个计分板将追踪模型是随着时间推移变得更好还是更差,这样公司就无法隐瞒其错误。

其次,他们认为我们需要具有约束力的规则。他们将其与处理其他行业的方式进行了对比:

  • 像家用电器一样: 正如冰箱每隔几年必须符合更严格的能源标准一样,AI 模型也必须符合更严格的偏见标准。你不应该允许发布一个比旧版本更有偏见的新模型。
  • 像医药一样: 如果一种新药有危险的副作用,我们不会永远禁止它,而是限制谁可以使用它。同样,如果一个 AI 的偏见过大,它应该被禁止从事招聘或法律决策等高风险工作。
  • 像汽车一样: 如果一辆车非常耗油,政府会对公司征收税款。作者建议实施一种“偏见税”,即如果公司的 AI 更不公平,则需要支付更多费用。

最后,作者认为我们需要停止玩捉迷藏的游戏。目前,开发这些模型的人对他们的秘密(如训练数据和代码微调方式)对外保持封闭。论文指出,要解决这个问题,独立的研究人员需要看到 AI 的内部运作机制,就像安全检查员需要查看汽车引擎盖下的情况一样。

论文以严肃的基调结束:这些解决方案可能还不够。问题可能已经如此巨大,以至于我们需要重新思考构建这些技术的初衷。作者敦促我们迅速行动,以免这种偏见的“雪球”变成一场伤害现实生活中人们的、无法阻挡的雪崩。他们希望我们共同努力——科学家、公司和政府——以确保我们的数字助手最终不会成为我们的敌人。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →