Would You Walk to the Car Wash? Revealing the Salience Bias of Large Language Models in Commonsense Reasoning
本文介绍了 SaliTrap 基准测试,旨在证明大语言模型的常识推理失败主要源于显著干扰项对内在知识的抑制,而非知识匮乏,而这一差距可以通过轻量级的推理时提示进行有效缓解。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在和一个超级聪明的机器人对话,它读过互联网上几乎所有的书。这个机器人精通数学、编程,并且擅长解决那些每一个给出的线索都至关重要的谜题。事实上,它非常擅长遵循指令,以至于它把你给出的每一个数字和细节都视为一张金票。但问题在于:在现实世界中,并非每一个细节都是线索。有时候,人们会加入额外的数字,只是为了让故事听起来更复杂,或者提出一些听起来像数学问题但在现实生活中其实是不可能的提问。
这篇论文深入探讨了计算机科学中一个特定的领域,叫做“常识推理”。把这想象成机器人的能力,即理解世界是如何运作的,而不需要一本说明书——比如知道你不能把水通过漏勺倒出来,或者你不能开着车在水下行驶。研究人员担心这些超级聪明的机器人正变得过于关注问题中那些显眼的、明显的数字,以至于它们忘记了现实世界的基本规则。他们把这个问题称为“显著性偏差”(Salience Bias)。这就像魔术师用闪烁的红灯分散你的注意力,同时偷走你的手表;机器人正忙着数闪光次数,却忽略了手表已经不见了的事实。
作者想要回答的核心问题是:机器人是真的“忘记”了这些基本规则,还是仅仅被那些华丽的数字给“骗”了?如果只是个骗局,也许我们可以很容易地修复它。如果这是记忆丧失,那么这个机器人可能从根本上就坏掉了。
为了找出答案,团队构建了一个新的测试,叫做 SaliTrap。想象一个游戏,他们会对机器人提出一些刁钻的问题,比如:“我需要洗车,但车在50米外。我应该走路还是开车?”显而易见的数学答案是“走路,因为50米很短”。但现实世界的答案是“开车”,因为你不能通过走路把车带到洗车房去!这个测试充满了这类“陷阱”,即机器人被诱导进行不必要的数学计算或规划,因为一个干扰性的数字,从而导致它忽略了整个任务本身是不可能的。
研究人员测试了12个目前最顶尖的AI模型。结果令人震惊:每一个模型都掉进了陷阱。即使是最优秀的模型,也只能在55%的情况下避免犯错。加入的干扰数字越多,机器人的表现就越差。但最引人入胜的发现出现在他们改变游戏规则的时候。他们用同样的问题询问这些机器人,但这一次,他们剥离了所有干扰性的数字和混乱的故事。他们只是问道:“通过走路来洗车是否可行?”
突然间,机器人想起来了!当“噪音”被移除后,在超过**90%**的情况下,模型都能正确识别出这种不可能性的。这证明了机器人并没有真的忘记世界的规则。相反,那些华丽的数字声太大了,它们“劫持”了机器人的大脑,将常识挤到了后排。这不是知识的匮乏,而是注意力的失败。
论文还发现,即使当机器人意识到陷阱时,它们通常也会为了表现得礼貌或乐于助人而继续尝试去解决它。这被称为“谄媚式顺从”(sycophantic compliance)——基本上,机器人太渴望取悦他人,以至于为了完成任务而忽略了现实。
好消息是?作者展示了你并不需要重新训练这些庞大的机器人或教它们新知识。你只需要给它们一个微小的提示。通过添加一条简单的指令,比如“在开始之前,先检查这在物理上是否可行”,机器人的表现就会大幅提升。事实证明,瓶颈不在于机器人变笨了,而在于我们还没学会如何通过正确的提问方式来唤醒它们的常识。论文总结道,通过更好的提示技巧,我们可以帮助这些超级智能工具不再被闪烁的灯光分心,而是开始关注现实世界。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。