Information Discernment in Large Language Models
本文介绍了 Learn2Discern 框架,旨在揭示大型语言模型始终无法根据来源可靠性或真实性来恰当地权衡信息,这一关键缺陷经用户研究证实会削弱信任,并且尽管模型规模有所增加,该问题依然存在,但可以通过简单的推理时干预措施来缓解。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一名试图破解谜团的侦探。你对自己发生的事情有一个自己的理论,但随后你开始收到来自公众的线索。有些线索来自一位经验丰富、诚实的警察;而另一些则来自一个只想制造麻烦的惯犯骗子。有些线索帮助你接近真相,而另一些则让你误入歧途。大问题在于,你的侦探大脑知道如何权衡这些线索吗?你会更多地听取诚实警察的意见,还是会被最响亮的声音所分心?当一个线索对你有帮助时,你会改变主意,还是会固执己见,即便原本的猜测是错误的也依然坚持原有的看法?
这正是科学家们正在询问关于现代“大语言模型”(LLMs)的问题。这些是驱动聊天机器人和搜索引擎的超级智能计算机程序。它们在海量的互联网数据上进行训练,但它们也需要查阅新的信息来回答它们尚不知道的问题。问题在于,互联网是一个嘈杂的地方。它充满了可靠的新闻网站,但也充满了假新闻、谣言和流行但错误的想法。如果一个计算机程序无法分辨可靠来源与流行的骗子,或者无法分辨有用的线索与误导性的线索,它就可能向数百万人传播错误信息。这篇论文深入探讨了这些“数字侦探”是否真的擅长从噪音中筛选出真相。
研究人员(来自密歇根大学的一个团队)创造了一种测试这种技能的新方法,他们称之为“信息辨别力”(information discernment)。他们设计了一个巨大的实验,涉及 13 种不同的 AI 模型和近 67 万次试验。他们向模型提出已知答案的问题,给它们一个“先验”信念(模型在之前的想法),然后向它们提供来自特定来源的新说法。有时来源是高度可靠的,有时是边缘网站。有时新说法更接近真相,有时则完全错误。他们想看看模型是否会对好的来源和有帮助的说法做出更多的更新。
结果令人震惊。论文发现,总体而言,这些 AI 模型在进行这种辨别方面表现得很糟糕。在决定信任哪个来源方面,它们的表现几乎不比随机猜测好多少。事实上,模型因为一个来源仅仅是因为它“流行”(比如访问量很大的网站)而听从它的可能性,是听从“可靠”来源(比如经过事实核查的新闻机构)的两倍。这就像是侦探忽略了警察,而去听从那个拿着最大扩音器的人。此外,模型似乎并不在意一条新信息是帮助它们接近真相还是让它们远离真相;它们在两种情况下的信念更新程度大致相同。
该团队还检查了让模型变得更大或更新是否能解决这个问题。他们发现,更新、更大的模型在识别说法中的真相方面略有进步,但它们仍然无法学会区分可靠与不可靠的来源。这表明,仅仅让 AI 变得更“聪明”或训练得更久,并不会自动教会它去批判性地思考信息的来源。然而,也有一个好消息:研究人员发现,一些简单的技巧,比如要求模型在回答之前先评估来源的可靠性,可以显著提高其表现。
为了确保这不仅仅是一个计算机科学问题,研究人员还询问了 299 名真实人类用户。他们发现,人们绝对非常在意这些技能。当用户被告知一个聊天机器人忽略了可靠来源,或者在原本正确时改变了主意时,他们表示会降低对该机器人的信任度并减少使用。这证实了辨别信息的能力不仅仅是一个技术指标;它是构建人们真正可以信赖的 AI 的核心要求。
简而言之,这篇论文揭示了虽然我们目前的 AI 模型在检索信息方面非常出色,但在判断信息质量方面却相当盲目。它们倾向于追随流行度而非真相,并且难以正确更新自己的信念。但好消息是,通过一些简单的指令,我们可以帮助它们看得更清楚一点,使它们成为对每个人都更安全、更有用的工具。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。