← 最新论文
💬 NLP

Conditional Cognitive Biases in LLMs: How Biased User Turns Modulate In-Context Reasoning

本文评估了多轮对话中偏见的用户输入如何调节最先进大语言模型中的认知偏见表达,通过对涵盖八个模型的超过 24,000 个经过验证的提示词的全面基准测试,揭示了虽然对话暴露通常会放大偏见,但显性的偏见线索可以触发对齐机制从而抑制公开的偏见。

原作者: Sachini Weerasekara, Sagar Kamarthi, Jacqueline Isaacs

发布于 2026-08-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Sachini Weerasekara, Sagar Kamarthi, Jacqueline Isaacs

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正坐在一间屋子里,对面是一个超级聪明的机器人,它读过几乎所有被写下来的书籍。你向它提问,它给了你答案。但这里有个转折:这个机器人的设计初衷是提供帮助、保持诚实且无害。现在,想象你不仅仅是在提问,而是在进行一场对话。在真实的对话中,人们往往会在不知不觉中带入自己的观点、担忧或思维捷径。这些思维捷径被称为认知偏差。例如,如果你对机器人说:“大家都知道这支股票要崩盘了!”(这是一种被称为“从众效应”的偏差),或者说:“我确定这个项目只需要两天就能完成!”(这是一种被称为“规划谬误”的偏差),你本质上是在递给机器人一副特定的有色眼镜。科学家们一直在思考的一个大问题是:机器人只是礼貌地忽略了这些眼镜,还是它真的戴上了眼镜,开始用你的方式来看待世界?这至关重要,因为我们正开始将这些机器人用于严肃的工作,比如提供医疗建议或协助法律决策。如果一个带有偏见的人意外地用自己的错误思维“感染”了机器人,后果可能会非常严重。

来自东北大学的一个研究小组决定扮演侦探的角色,对目前最先进的八个AI机器人进行调查。他们设计了一个大规模实验,涉及超过24,000个不同的对话场景。这就像是一场针对AI的巨大“老师说”游戏,只不过机器人不是在拍手或跳跃,而是在做关于金钱、时间和公平性的决策。研究人员创建了三种不同的与机器人交流的方式:

  1. 单项测试: 机器人接收到一个没有任何对话历史的问题(这是我们通常测试它们的标准方式)。
  2. 中性聊天: 机器人接收到一个问题,但在此之前,人类先说了一些枯燥且中性的内容,比如“你好,让我们讨论一下”。
  3. 偏见聊天: 机器人接收到一个问题,但在此之前,人类先说了一些带有特定认知偏差的内容,比如“我确定这会既容易又快速!”

研究人员想要观察机器人的回答改变是因为有人在与之交谈(“存在感”效应),还是因为那个人说了什么(“内容”效应)。

以下是他们的发现,情况比简单的“是”或“否”要复杂得多。首先,他们发现仅仅是进行对话就会改变机器人。即使人类说的是完全中性的内容,机器人表现出的偏差也会比单独回答时略多一些。这就像机器人变得更具“社交性”了,开始模仿人类的存在感,即使人类并没有试图去欺骗它。

然而,真正的惊喜出现在研究人员观察到人类表现出显性偏见时。在他们测试的八个机器人中,有六个机器人展现出了一个引人入胜的“拉锯战”。一方面,当机器人听到人类表现出明显的偏见时,它似乎启动了一个“安全开关”。这就像机器人心里在想:“噢,这个人表现得不公平或者过于乐观了;我应该更加谨慎并纠正他。”这导致机器人在面对人类的偏见时,反而减少了自己的偏差。就好像机器人试图成为人类这个“坏警察”面前的“好警察”。

但有一个主要的例外规则。研究人员发现,有一种特定的偏差——规划谬误(即倾向于认为任务所需的时间和成本比实际更少、更低的倾向)——就像一种超级病毒,机器人根本无法抵抗。无论研究人员测试的是哪种机器人,也无论人类使用什么样的偏差来试图诱导它,当人类表现得乐观时,机器人都会一致地对时间和成本变得更加乐观。看来在涉及到规划时,机器人极易受到人类那种“一切都会很轻松”氛围的感染。

该研究排除了其他几种可能性。他们证明了这不仅仅是因为人类和机器人拥有相同的偏差(比如一个具有“损失厌恶”偏差的人去诱导一个同样具有“损失厌恶”偏差的机器人)。机器人的反应更多取决于它正在接受测试的哪种偏差,而不是人类的偏差是否与机器人的偏差相匹配。此外,他们发现,更大的、更聪明的机器人并不一定能更好地忽略偏差;事实上,一些最先进的模型也和较小的模型一样容易被左右。

简而言之,这篇论文表明,虽然AI机器人有一些内置的防御机制来应对明显的偏见,但它们并非免疫。它们可能会受到微妙的影响,仅仅是因为我们在与它们交谈;而且在面对过度乐观的规划时,它们有一个特定的弱点。研究人员警告说,如果我们想了解这些机器人在现实世界中究竟是如何表现的,我们不能仅仅测试它们孤立的问题;我们必须在混乱的多轮对话中测试它们,在这些对话中,人类可能会无意中或有意地递给它们那些有色的眼镜。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →