Whether LLMs Can Navigate Beliefs and Facts Depends on How You Phrase It
本文揭示了大型语言模型在权衡用户信念与事实方面的能力对措辞高度敏感,因为它们进行事实核查的默认倾向往往会导致其覆盖已陈述的信念,尤其是在使用特定的认识论动词时。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在日常对话那细微的喧嚣中,人类不断地将我们所知的真相与我们仅仅认为的真相交织在一起。我们可能会说,“我觉得答案是三,”或者“我想那是对的,”将个人的信念与对世界的陈述融合在一起。这些表达信念的方式不仅仅是礼貌性的填充词;它们是人类交流的基本组成部分,往往承载着一种有别于硬性事实的分量。对于被称为大语言模型的这一代人工智能而言,驾驭这种区别正变得日益关键。随着这些系统从研究实验室走向我们的口袋和办公室,充当助手,它们被期望能以处理客观数据时同样的严谨程度来处理我们的个人想法。挑战在于一个微妙但深刻的难题:当一个人陈述了一个事实错误的信念时,机器理解到它被要求确认的是这个“信念”本身,还是会被陈述中的“错误”所干扰?
最近,由韩国科学技术院(KAIST)和台湾科技大学的研究人员进行的一项研究,调查了正是这种摩擦。他们旨在探究这些智能系统是否能够将“承认用户的想法”这一行为与“验证该想法之真实性”这一行为区分开来。为此,他们并没有依赖单一类型的提问,而是探索了人类表达方式的广阔图景。他们测试了十种不同的语言模型,使用了十八种不同的表达信念的方式,涵盖了从自信的“我确定”到犹豫的“我隐约记得”,甚至包括怀疑的“我严重怀疑”。实验设置非常直接:研究人员向模型展示一个类似“我相信天空是绿色的”陈述,随后紧跟问题:“我是否相信天空是绿色的?”无论天空是否真的不是绿色的,正确答案始终是“是”,因为问题询问的是用户的心理状态,而非天空的颜色。
结果显示,这些模型的思考方式存在令人惊讶的不一致性。正确确认用户信念的能力并非一项固定的技能;它会根据引入该信念的具体措辞而发生剧烈变化。当模型被问及用“我隐约记得”来表达的信念时,它们的表现良好,即使在底层事实错误的情况下也能正确识别出该信念。然而,当措辞转变为“我严重怀疑”时,模型开始出错,经常对“用户是否持有该怀疑”的问题回答“否”。在某些情况下,模型在处理事实陈述与错误陈述之间的性能差距高达百分之五十,而在另一些情况下,模型在处理错误陈述时的表现甚至优于处理正确陈述。这表明,模型并非仅仅无法理解“信念”的概念;相反,它们的成功或失败完全取决于引入信念的语言触发词。
研究人员进行了更深入的挖掘以了解其原因,并发现模型正遭受着一种任务混淆。当面对一个错误的说法时,模型倾向于默认进入“事实核查模式”。它们并没有回答“你是否相信这个?”,而是默默地自问:“这是真的吗?”,然后根据该主张的真实性进行回答,从而有效地覆盖了用户所陈述的信念。通过检查模型进行的内部推理步骤,这一行为得到了证实。在许多模型回答错误的实例中,它们明确地将时间花在了验证主张的事实上。当研究人员加入一条简单的指令,告诉模型“不要进行事实核查”时,模型在错误主张上的错误率显著下降,并且变得更擅长单纯地承认该信念。这表明,模型具备追踪信念的能力,但它们经常被自身强烈的纠正错误信息的冲动所绊倒。
为了观察这是否是一个深层的机械性问题,研究人员观察了模型的注意力机制,观察系统在生成答案时关注文本的哪些部分。他们发现,当模型未能确认一个错误的信念时,它对错误主张本身的注意力明显高于成功确认时的注意力。在最后一次测试中,研究人员在生成答案的过程中人为地抑制了对该主张的注意力。在一个特定的模型中,这种干预成功地提高了信念确认的准确性,且没有破坏其回答其他类型问题的能力。这表明,问题不在于根本缺乏理解能力,而在于当内容为假时,模型有一种过度关注该内容的特定倾向。
最终,这项研究阐明了区分信念与事实的挣扎并非所有情况下的统一弱点。这是一种微妙的行为,高度依赖于问题是如何提出的,以及模型如何解释其角色。虽然这些系统通常被设计为提供帮助且准确,但它们核实事实的本能有时会干扰它们倾听用户真实想法的能力。研究人员总结道,未来的路径在于开发能够让这些模型在不立即试图纠正用户观点的情况下,先承认用户视角的方法,从而确保即使在对话偏离正确领域时,它们也能成为忠实的倾听者。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。