大语言模型改变了我们与计算机交互的方式,它们成为了能够总结新闻、回答复杂问题并起草文档的强大引擎。这些系统通过根据从海量文本中学习到的模式来预测句子中的下一个词来工作。然而,一个持久的缺陷削弱了它们的可靠性:它们有时会捏造事实。这种现象被称为“幻觉”,即当模型生成的的信息听起来很合理,但要么缺乏原始材料的支持,要么与原始材料直接矛盾时,就会发生这种情况。对于依赖这些工具处理关键任务的用户来说,区分一份有用的摘要和一段编造的故事是非常困难的。核心挑战不仅在于知道存在错误,还在于精准定位究竟哪些词是错误的,并找到证明它们错误的原始文本的具体部分。如果没有这种细粒度的细节,验证长篇文档的真实性仍然是一个乏味且需要人工完成的过程。
东京科学大学的研究人员开发了一种新方法来解决这个问题,将重点从判断整个文本转向检查单个词汇。该方法并非要求计算机简单地将整个段落标记为真或假,而是像放大镜一样,逐词扫描生成的输出内容,以查看其是否可以追溯到来源。研究团队基于一个简单而强大的观察结果:如果摘要中的一个词忠实于原文,那么计算机应该能够仅利用原始材料作为引导来预测这个词。相反,如果一个词是幻觉,那么它将无法从原文中被预测出来,因为该信息在原文中根本不存在。通过训练一个模型来测试这种可预测性,研究人员创建了一个系统,该系统不仅能标记出虚构的词汇,还能高亮显示支持正确信息的输入端具体证据。
该过程首先将生成的文本分解成有意义的块(例如短语或从句),而不是将其视为一个单一的整体。随后,系统会从这些块中取出一个词并暂时将其隐藏,然后要求模型仅根据原始输入文本来猜测该词应该是多少。如果模型能够利用来源自信地猜出隐藏的词,系统就会将其标记为忠实的。如果模型难以做出猜测,或者置信度得分较低,系统就会将该词标记为潜在的幻觉。至关重要的是,由于模型必须查看源文本来进行猜测,它自然会在输出词与帮助其做出判断的特定输入部分之间建立一种联系。这创建了一张证据图谱,向用户展示了模型是在哪里找到其信息的,或者在出错的情况下,是在哪里未能找到任何支持。
为了测试这个想法,研究人员使用了一个包含数千个示例的数据集,在这些示例中,人类已经识别出了生成的答案中哪些部分在事实上有误。他们将这种新方法与现有技术进行了对比,包括那些依赖大型复杂模型来阅读和评判文本的技术。结果表明,他们这种更轻量、更聚焦的方法在发现错误方面表现得异常出色。虽然其他方法有时会完全错过错误,但这个新系统成功识别了绝大多数幻觉词汇,特别是那些完全凭空捏造的词汇。它还被证明能有效地将摘要中的正确词汇链接回来源中的正确句子,为用户提供了一条清晰的证据追踪路径。
然而,研究也揭示了该系统在检测某些类型错误时的特定弱点。当幻觉表现为直接的矛盾时(例如,将数字从“四”改为“二十”,且改动后的内容在语法和语境上仍与原文相似),该方法会显得力不从心。在这些情况下,模型发现周围的语境如此相似,以至于它依然对自己的预测保持自信,从而未能识别出细微的含义变化。研究人员指出,虽然该系统擅长发现完全缺失于来源的信息,但它仍需要进一步改进,以捕捉这些更具欺骗性的冲突类错误。尽管存在这一局限性,这项工作仍展示了使人工智能更加透明化的重大进步,通过将每一项主张直接与其来源相连,为验证机器生成内容的真实性提供了一种切实可行的方法。
技术摘要:基于输入侧证据对齐的幻觉跨度检测
问题陈述
大语言模型(LLMs)虽然在摘要生成和问答等条件文本生成任务中取得了显著进展,但仍容易出现幻觉问题——即生成的内容不受输入文本支持或与输入文本相矛盾。现有的检测方法主要将幻觉视为句子级或文档级的二分类问题。虽然这些方法在评估整体事实性方面有效,但无法定位具体的幻觉跨度(spans),也无法识别与之对应的输入证据。这种局限性阻碍了模型预测的可解释性,并增加了验证生成内容内容的难度,尤其是在处理长文档时,人工追踪变得非常困难。此外,考虑到 LLM 的快速演进,获取用于训练的人工对齐的输入-输出对既昂贵又不切实际。
方法论
作者提出了一项新颖的任务:具有输入侧证据对齐的幻觉跨度检测。该任务旨在同时识别生成文本中的幻觉跨度,并将输出标记(tokens)与其在输入中的对应证据进行对齐。该方法基于以下观察:忠实的输出标记通常可以从其在输入中的支持上下文进行预测,而幻觉标记则不能。
核心框架
该方法将幻觉检测公式化为一个基于输入的掩码标记预测问题,其灵感来源于非参数化掩码语言模型(NPM)。该系统没有依赖大型解码器架构的 LLM,而是采用了一种轻量级的基于编码器的模型。
训练策略(远程监督):
- 跨度分割(Span Segmentation): 使用语义角色标注(SRL)将输出文本分割成具有语义意义的跨度。提取谓词及其参数以形成跨度;不属于任何谓词或参数的词(如连词)会被排除在外。
- 掩码预测(Masked Prediction): 在训练期间,跨度会被掩码为特殊标记(``)。模型被训练为仅使用输入文本的表示来预测这些被掩码的跨度。
- 置信度指标: 针对掩码跨度 s 与输入跨度 (i,j) 的预测置信度定义为掩码标记嵌入与输入标记嵌入之间余弦相似度的总和:
c(s,i,j):=sim(ms,di)+sim(me,dj)
- 损失函数: 一个自定义损失函数旨在鼓励忠实跨度具有高置信度,并使幻觉跨度具有低置信度。它惩罚那些获得高置信度的幻觉跨度以及获得低置信度的忠实跨度,并对“困难”样本进行额外加权。
推理:
- 与训练不同,推理是在**标记级(token level)**进行的。每个输出标记被单独掩码,模型根据置信度分数检索最相关的输入标记。
- 分类: 如果一个输出标记的最大置信度分数低于阈值 λh,则将其分类为幻觉。
- 对齐: 产生最高置信度分数的输入标记作为证据对齐。
- 聚合: 将标记级预测聚合到词级;只有当一个词的所有子词标记都被归类为幻觉时,该词才被视为幻觉。
核心贡献
- 任务定义: 引入了一项新任务,即同时检测幻觉跨度并将其与输入证据对齐,从而超越了二元的句子级分类。
- 高效架构: 开发了一种轻量级的基于编码器的方法,避免了大型解码器 LLM 的计算开销,且不需要人工对齐的训练数据(利用了远程监督)。
- 双重输出: 该框架能够同时产生幻觉检测标签和标记级的证据对齐。
实验结果
该方法在涵盖问答(QA)和新闻摘要任务的 RAGTruth 数据集上进行了评估。
自动评估:
- 所提出的方法在 QA 和摘要任务中均实现了最高的召回率(分别为 82.7% 和 38.0%),在召回率方面优于 Llama-SFT 和 LettuceDetect 等基线模型,这在漏检幻觉代价极高的场景中至关重要。
- 虽然其精确度低于某些基线(例如摘要任务中的 Llama-SFT),但高召回率表明该方法能有效识别大部分幻觉内容。
- 基线模型 OTAlign 表现较差,可能是由于对齐长度差异显著的句子具有难度。
人工评估:
- 人工标注员评估了预测的输入侧证据对齐的质量。
- 对于**忠实(faithful)和无根据幻觉(baseless hallucination)**的词汇,该方法获得的平均对齐得分约为 2.0(基于 0-3 分制),表明检索到的输入标记是相关的证据。
- 冲突幻觉(Conflict Hallucinations): 该方法在处理冲突幻觉(即输出与输入矛盾)时表现欠佳,经常为这些标记分配高置信度分数。这归因于冲突文本与输入上下文之间的高度语义相似性,从而干扰了基于相似度的置信度估计。
重要性与局限性
论文声称,所提出的方法能有效检测幻觉跨度并识别有意义的输入侧证据,这一点通过对对齐质量的人工评估得到了证实。该方法为验证生成内容提供了一个实用的解决方案,无需承担高昂的人工对齐数据成本。
然而,作者也承认了特定的局限性:
- 冲突检测: 与“无根据”的幻觉相比,该方法在检测“冲突”型幻觉方面效果较差,因为冲突文本与输入之间的高相似性会导致产生虚高的置信度。
- 推理效率: 逐标记掩码和重新编码的过程导致推理成本随输出长度呈线性增长,这对于长文本而言可能计算成本较高。
- 范围: 实验仅限于使用 RAGTruth 基准测试的 QA 和新闻摘要任务;该方法在其他领域、语言或 LLM 系列中的泛化能力仍有待研究。
作者总结道,虽然该方法对于无根据的幻觉非常有效,但未来的工作应侧重于开发更复杂的置信度估计方法,以更好地处理冲突型幻觉并提高推理效率。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。