← 最新论文
💻 computer science

Hallucination Span Detection with Input-Side Evidence Alignment

本文引入了一项新任务和一种基于编码器的方法,通过利用输入证据中忠实标记的可预测性,来同时识别幻觉并将其与来源对齐,从而检测大语言模型生成文本中的幻觉片段。

原作者: Miyu Yamada, Yuki Arase

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Miyu Yamada, Yuki Arase

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大语言模型改变了我们与计算机交互的方式,它们成为了能够总结新闻、回答复杂问题并起草文档的强大引擎。这些系统通过根据从海量文本中学习到的模式来预测句子中的下一个词来工作。然而,一个持久的缺陷削弱了它们的可靠性:它们有时会捏造事实。这种现象被称为“幻觉”,即当模型生成的的信息听起来很合理,但要么缺乏原始材料的支持,要么与原始材料直接矛盾时,就会发生这种情况。对于依赖这些工具处理关键任务的用户来说,区分一份有用的摘要和一段编造的故事是非常困难的。核心挑战不仅在于知道存在错误,还在于精准定位究竟哪些词是错误的,并找到证明它们错误的原始文本的具体部分。如果没有这种细粒度的细节,验证长篇文档的真实性仍然是一个乏味且需要人工完成的过程。

东京科学大学的研究人员开发了一种新方法来解决这个问题,将重点从判断整个文本转向检查单个词汇。该方法并非要求计算机简单地将整个段落标记为真或假,而是像放大镜一样,逐词扫描生成的输出内容,以查看其是否可以追溯到来源。研究团队基于一个简单而强大的观察结果:如果摘要中的一个词忠实于原文,那么计算机应该能够仅利用原始材料作为引导来预测这个词。相反,如果一个词是幻觉,那么它将无法从原文中被预测出来,因为该信息在原文中根本不存在。通过训练一个模型来测试这种可预测性,研究人员创建了一个系统,该系统不仅能标记出虚构的词汇,还能高亮显示支持正确信息的输入端具体证据。

该过程首先将生成的文本分解成有意义的块(例如短语或从句),而不是将其视为一个单一的整体。随后,系统会从这些块中取出一个词并暂时将其隐藏,然后要求模型仅根据原始输入文本来猜测该词应该是多少。如果模型能够利用来源自信地猜出隐藏的词,系统就会将其标记为忠实的。如果模型难以做出猜测,或者置信度得分较低,系统就会将该词标记为潜在的幻觉。至关重要的是,由于模型必须查看源文本来进行猜测,它自然会在输出词与帮助其做出判断的特定输入部分之间建立一种联系。这创建了一张证据图谱,向用户展示了模型是在哪里找到其信息的,或者在出错的情况下,是在哪里未能找到任何支持。

为了测试这个想法,研究人员使用了一个包含数千个示例的数据集,在这些示例中,人类已经识别出了生成的答案中哪些部分在事实上有误。他们将这种新方法与现有技术进行了对比,包括那些依赖大型复杂模型来阅读和评判文本的技术。结果表明,他们这种更轻量、更聚焦的方法在发现错误方面表现得异常出色。虽然其他方法有时会完全错过错误,但这个新系统成功识别了绝大多数幻觉词汇,特别是那些完全凭空捏造的词汇。它还被证明能有效地将摘要中的正确词汇链接回来源中的正确句子,为用户提供了一条清晰的证据追踪路径。

然而,研究也揭示了该系统在检测某些类型错误时的特定弱点。当幻觉表现为直接的矛盾时(例如,将数字从“四”改为“二十”,且改动后的内容在语法和语境上仍与原文相似),该方法会显得力不从心。在这些情况下,模型发现周围的语境如此相似,以至于它依然对自己的预测保持自信,从而未能识别出细微的含义变化。研究人员指出,虽然该系统擅长发现完全缺失于来源的信息,但它仍需要进一步改进,以捕捉这些更具欺骗性的冲突类错误。尽管存在这一局限性,这项工作仍展示了使人工智能更加透明化的重大进步,通过将每一项主张直接与其来源相连,为验证机器生成内容的真实性提供了一种切实可行的方法。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →