← 最新论文
💬 NLP

Arguments that Alter Minds: LLM Rationales Sway Human (and LLM) Notions of Plausibility

这项研究表明,人类和大型语言模型(LLM)在对常识性答案的合理性判断上,都会显著受到由大型语言模型生成的论据的影响,这既展示了一种研究人类认知的全新方法,也引发了人们对于人工智能可能在即使是常识领域也会过度影响人类信念的担忧。

原作者: Shramay Palta, Peter Rankel, Sarah Wiegreffe, Rachel Rudinger

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Shramay Palta, Peter Rankel, Sarah Wiegreffe, Rachel Rudinger

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在玩一个游戏,你需要猜猜接下来的故事会发生什么。例如:“如果一个人掉了一个玻璃杯,会发生什么?”你可能会猜:“它会碎了,”或者“它会弹起来。”通常,“它会碎了”是显而易见的答案,而“它会弹起来”是一个愚蠢的猜测。

在这项研究中,研究人员提出了一个简单但令人担忧的问题:机器人(人工智能)能否通过言语说服你,从而改变你对事实的认知,即便你本身就知道答案?

以下是他们是如何进行的,以及他们的发现,我通过几个简单的类比来进行解释。

背景设定:“常识辩论俱乐部”

研究人员选取了 100 个常识性问题(就像玻璃杯的例子),并为每个问题选择了两个答案:

  1. 黄金答案(The Gold Answer): 大多数人都认同正确的那个。
  2. 干扰项(The Distractor): 愚蠢的、通常是错误的那个答案。

然后,他们利用强大的 AI(GPT-4o)为每一个答案编写了两类论点:

  • “正方”论点(The "Pro" Argument): 一段解释为什么这个答案完全合理的演讲。
  • “反方”论点(The "Con" Argument): 一段解释为什么这个答案是个糟糕主意的演讲。

他们将这些问题和论点展示给 3,000 名真实人类和 13,600 个不同的 AI 模型,要求他们在 1 到 5 分的范围内对答案的“合理性”(plausible)进行评分。

结果:AI 的魔术表演

1. “愚蠢答案”获得了加分

当 AI 为愚蠢的答案(干扰项)提供**“正方”论点**时,人类和其他 AI 开始觉得:“嘿,这其实挺有道理的!”

  • 类比: 这就像是一个口才极好的朋友试图说服你,把蹦床当作掉落玻璃杯的好地方。尽管你知道玻璃通常会碎,但朋友的逻辑让你停顿了一下,并给“弹起来”这个想法打了更高的分数。

2. “显而易见的答案”遭到了削弱(针对人类)

这是最奇怪的部分。当 AI 为显而易见正确的答案(黄金答案)提供**“正方”论点时,人类的评分反而降低**了。

  • 类比: 想象你百分之百确定玻璃会碎。这时,一个机器人走进来并说:“嗯,玻璃碎掉也是合理的。”你可能会想:“等等,你为什么要解释这个?这太显而易见了!如果你非要解释它,也许是我错了。”
  • 研究人员称之为“过度解释”(underselling)。通过试图证明显而易见的事实,AI 不小心让你怀疑自己的信心。

3. “反方”论点是一柄重锤

当 AI 提供**“反方”论点**(反对某个答案)时,它在降低评分方面非常有效。

  • 类比: 如果机器人说:“玻璃不会碎,因为它是由橡胶做的。”人们会立即停止相信“玻璃会碎”这个答案。负面论点的力量比正面论点更强。

4. 机器人 vs. 人类

AI 模型(机器人)比人类更容易被左右。

  • “回声壁”效应(The "Echo Chamber" Effect): AI 模型似乎非常喜欢由它们的“大哥”(GPT-4o)所写的论点。当 GPT-4o 写下一个“正方”论点时,其他 AI 模型比人类更相信它。
  • 区别在于: 当 AI 试图解释显而易见的事实时,人类会感到困惑(降低了评分);但其他的 AI 在 AI 解释显而易见的事实时,反而会对该答案变得更加确信。

“锚定”规则

研究发现了一个关于我们的思想有多固执的规则:你最初的确定程度越高,就越难改变你的想法。

  • 类比: 如果你站在悬崖边(极高的评分),需要一阵大风(强有力的论点)才能把你推下去。如果你站在平地上(低评分),一阵微风就能把你吹倒。
  • 数据显示,初始评分是预测评分变化程度的最强指标。

核心启示

论文得出结论,大语言模型(LLM)可以扮演像“说服力极强的律师”的角色。 它们可以用言语诱导人类相信一个愚蠢的想法是正确的,也可以让人们怀疑一个正确的想法。

即使是在人类应该是“专家”(日常常识)的领域,AI 的话语也能改变我们对合理性的看法。研究人员警告说,如果 AI 能在“玻璃掉落”这种小事上欺骗我们,它就可能在处理那些我们并不太了解的、更严肃且复杂的课题时,欺骗我们。

简而言之: 不要只听答案本身,也要听听是谁在为它辩护。机器人的甜言蜜语可以让错误的事情听起来是对的,也能让正确的事情听起来充满疑虑。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →