← 最新论文
💬 NLP

Epistemic Familiarity is Associated With Belief Stability in Large Language Models

本文引入了 P-StaT 框架,旨在证明与处理陌生的合成陈述相比,大型语言模型在处理熟悉的虚构陈述时表现出更高的信念稳定性,从而揭示了认识熟悉度是缓解语义诱导的信念不稳定性的一项关键因素。

原作者: Samantha Dies, Courtney Maynard, Germans Savcisens, Tina Eliassi-Rad

发布于 2026-07-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Samantha Dies, Courtney Maynard, Germans Savcisens, Tina Eliassi-Rad

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个超级聪明的机器人如何区分事实、谎言和虚构故事。你可能会认为,一旦机器人学会了“真理”的规则,无论你如何提问,它都会恪守这些规则。但在大型语言模型(LLM)的世界里——也就是聊天机器人和搜索工具背后的强大 AI 大脑——情况却要动摇得多。这些模型就像是读遍了互联网几乎所有内容的巨型图书馆,但它们并不像人类那样“理解”事物;它们只是根据模式来预测下一个词应该是什么。科学家们面临的一个关键问题是:如果稍微改变语境或提问的方式,机器人的对事实的信念会保持稳定,还是会发生动摇甚至崩溃?这就是“认识论稳定性”(epistemic stability)的研究课题。如果一个机器人今天相信某个城市存在,但仅仅因为你在附近提到一个虚构故事就改变了主意,那这就是个问题。我们之所以关心这一点,是因为这些模型正越来越多地被用于为我们提供信息,我们需要知道它们的信念是坚如磐石,还是容易被一点点混乱所撼动。

于是,萨曼莎·迪斯(Samantha Dies)及其团队开展了一项新研究,他们决定通过“摇晃”机器人的世界来观察会掉出什么东西。他们构建了一个名为 P-StaT 的框架(代表“真理的扰动稳定性”,Perturbation Stability of Truth)。你可以把 P-StaT 想象成一种“信念压力测试”。研究人员选取了 21 个不同的 AI 模型,并给它们许多陈述句进行判断。其中一些是真实的事实(例如“苏拉特位于印度”),一些是显而易见的谎言,而最棘手的是那些“既非如此也非彼”的陈述——即在现实世界中既非真也非假的说法。

团队将这些“既非如此也非彼”的陈述分成了两个阵营。第一个阵营是熟悉的虚构(Familiar Fictional)陈述。这些是听起来像是出自故事书或电影的虚构事物,例如“比奇堡位于太平洋中”。尽管比奇堡并非真实存在,但 AI 在其训练数据中很可能见过它,因为它是一个受欢迎的卡通角色。第二个阵营是陌生的合成(Unfamiliar Synthetic)陈述。这些是完全崭新的、由奇怪词汇组合而成的内容,AI 很可能从未见过,例如“尤斯塔波尔城位于奥克兰尼亚”。这些设计初衷是为了让它们成为模型的“陌生人”。

研究人员玩了一场“如果……会怎样”的游戏。他们告诉 AI:“好吧,假设这些虚构的事物实际上是真的,”然后观察 AI 是否会突然开始怀疑它掌握的真实事实。这就像告诉一个人,“想象一下龙是真的,”然后问他,“那么,天空是蓝色的吗?”如果那个人突然说,“我不确定,也许因为有龙的存在,天空可能是绿色的,”那么这个人的信念系统就是不稳定的。

结果非常耐人寻味。当 AI 接触到陌生的合成陈述(那些完全陌生、古怪的内容)时,它变得非常动摇。在行为测试(即 AI 进行对话式交流)中,模型撤回其对真实事实信念的频率超过了 50%。这简直是抛硬币!如果你抛 100 次硬币,预期大约会有 50 次正面;在这里,AI 仅仅因为被完全陌生的事物搞混了,就比一半以上的次数更频繁地失去了对真实事实的信心。

然而,当 AI 接触到熟悉的虚构陈述(那些卡通城市和电影怪物)时,它表现得要冷静得多。它知道比奇堡是一个卡通场景,所以它不会让那个想法干扰它关于真实城市的知识。这项研究表明,AI 的不稳定不仅仅是因为词汇很奇怪;而是因为语境的感觉有多么“陌生”。模型似乎有一个它们见过的东西构成的“舒适区”,而当你把它们推向未知领域时,它们对真理的掌控力就会下滑。

研究人员还观察了当 AI 感到困惑时,最容易放弃哪些类型的“事实”。他们发现 AI 并不是随机遗忘事物。它倾向于放弃那些本身就已经有些模糊的事物——比如技术性的医学术语、晦涩的地理知识,或者带有一定歧义的陈述。这就像是 AI 的信念系统是一座纸牌屋:当你吹出一阵熟悉的虚构之风时,纸牌屋依然屹立;但当你吹出一场陌生荒诞的飓风时,那些原本就略显摇晃的纸牌(那些复杂的、技术性的内容)会最先倒塌。

简而言之,这篇论文表明,认识论熟悉度(epistemic familiarity)——即 AI 对某一主题了解程度的高低——是决定其信念稳定性的一个重要因素。如果要求 AI 对它从未见过的事务进行推理,它就更有可能产生幻觉,或者改变它原本已知的事实。作者并不是说 AI 坏掉了,而是向我们展示了,“稳定性”是衡量 AI 可靠性的一个新维度,可以与传统的“准确性”测试并列。事实证明,对于这些数字大脑来说,了解游戏的规则与了解游戏的规则本身同样重要。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →