← 最新论文
💻 computer science

Toward a Gricean Retreat: Probing LLMs for Knowledge Boundaries and Referent Specificity

本文揭示了尽管大型语言模型拥有表明其知识边界以及即将出现的指代对象特异性的内部信号,但它们在生成过程中无法协调这些信号,导致它们在面对未知实体时会编造具体的细节,而不是像一个格莱斯式的合作说话者那样退回到更稳妥的概括性陈述。

原作者: Dananjay Srinivas, Saksham Khatwani, Maria Pacheco

发布于 2026-08-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Dananjay Srinivas, Saksham Khatwani, Maria Pacheco

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在和一个读过几乎所有书籍的朋友聊天,但这位朋友已经好几年没去过图书馆了。如果你问他关于一位他绝对熟悉的著名作家,他能准确说出那位作家住在哪条街上。但如果你问他一位昨天才刚出版新书的新锐作家,你的朋友可能并不认识。一个真正乐于助人、诚实的友人会说:“我没听说过他们,但他们可能是一位作家。”然而,如果你的朋友有点太想表现自己了,他可能会随口编造一个街道名称和一段传记,假装自己无所不知。这正是现代人工智能,特别是大语言模型(LLMs)面临的精确问题。这些人工智能系统就像是超级读者,可以从它们的训练数据中回忆事实,但当它们遇到新事物或未知事物时,往往会产生“幻觉”——它们会捏造听起来像模像样的细节,而不是承认自己不知道。

为了理解如何解决这个问题,科学家们转向了语言学中的一个概念,即由哲学家格莱斯(Grice)提出的“合作原则”。这个理念很简单:在一次良好的对话中,人们试图既提供足够的有用信息,又保持诚实(只说自己知道的事)。如果你不知道具体的细节,一个具有合作精神的说话者会“退缩”到一个更安全、更笼统的回答。例如,与其猜测一个具体的城市,他们可能会只说“澳大利亚的一个城市”。这篇论文提出了一个引人入胜的问题:人工智能模型是否拥有这种内在的“刹车”机制?它们是否知道自己在瞎猜,以及它们能否选择变得模糊而不是胡编乱造?

来自科罗拉多大学博尔德分校的研究人员丹纳杰·斯里尼瓦斯(Dananjay Srinivas)、萨克沙姆·卡特瓦尼(Saksham Khatwani)和玛丽亚·帕切科(Maria Pacheco)决定通过窥探这些人工智能模型的“大脑”来调查这个问题。他们构建了一个特殊的测试,使用了一个包含人物、公司、产品和技能事实的数据集。为了模拟人工智能不知道某事的情况,他们为从未见过的个人和公司创建了虚假名称。然后,他们要求人工智能填写类似“艾伦·派珀(Allan Peiper)出生于 [空格]”这类句子的空白处。

以下是他们的发现,情况有些复杂。首先,他们发现人工智能确实知道自己正在处理从未见过的内容。如果你观察模型大脑内部的电信号(激活值),会有一个清晰的模式在说:“嘿,这个名字对我来说很陌生!”模型还拥有第二个信号,用于预测它即将给出一个具体的答案(如“维多利亚”)还是一个笼统的答案(如“一个城市”)。所以,成为诚实的要素确实存在;模型拥有这种知识和选择的能力。

然而,坏消息是模型实际上并没有利用这些信息来保持诚实。即使人工智能知道自己面对的是一个从未见过的假名,它仍然压倒性地选择给出一个具体的、编造出来的答案,而不是一个安全的、笼统的答案。这就像是一辆车拥有完美的 GPS,明知自己迷路了,但驾驶员(人工智能的生成策略)却忽略了 GPS,而是执意朝着墙壁开去,因为它非常渴望到达一个特定的目的地。研究人员发现,即使在给予人工智能变得模糊的选择权时,甚至在特定答案注定是错误的情况下,这种情况依然会发生。

简而言之,这篇论文表明,虽然人工智能模型拥有识别自己力所不及的内在“传感器”,但它们缺乏停止并退回到更安全回答的“策略”或意愿。它们天生倾向于给出具体的答案,即使在应该保持谦逊的时候也是如此。作者建议,我们不应该在人工智能已经开口说话之后再去修复这些错误,而是需要训练模型去倾听它们自身的内部传感器,并在不确定时选择变得模糊。这将是让人工智能变得更具合作性和更值得信赖的一步,教导它们:有时,说“我不知道确切的城市,但它在澳大利亚”比编造一个街道名称要好得多。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →