← 最新论文
💻 computer science

A framework for hallucinations explainability in text summarization

本文提出了一个新颖的框架,该框架通过在增强型 SMILE 流水线中引入基于语义不稳定性(semantic instability)和 SHAP 归因分析的幻觉严重度评分(HSS),以有效地检测、量化并解释基于大语言模型(LLM)的文本摘要中的幻觉现象。

原作者: Omnia Abd Al-Azeem Hussieny, Samah El-Tantawy, Doaa Shawky, Ehab Y. Abdel Maksoud

发布于 2026-08-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Omnia Abd Al-Azeem Hussieny, Samah El-Tantawy, Doaa Shawky, Ehab Y. Abdel Maksoud

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代人工智能的版图中,大型语言模型已成为写作、回答问题和总结复杂信息的强大引擎。这些系统通过海量文本进行训练,学习如何以惊人的流畅度预测句子中的下一个词。然而,这种流畅性伴随着一个隐藏的缺陷:模型有时会捏造事实。在自然语言处理领域,这种现象被称为“幻觉”。当一个系统生成的文本听起来自信且语法正确,但实际上完全是凭空捏造,或者直接与它本应总结的源材料相矛盾时,就会发生这种情况。虽然这些错误在日常闲聊中看似微不足道,但在医疗、法律分析或科学研究等准确性至关重要的关键环境中,它们会变得非常危险。研究人员面临的核心挑战不仅在于如何识别这些谎言,更在于如何衡量它们的严重程度并理解其发生的原因——这需要超越简单的词汇重叠检查,转而对模型的内部逻辑进行更深层次的调查。

一组研究人员开发了一种应对这一问题的新方法,创建了一个类似于对 AI 摘要进行“压力测试”的框架。他们并没有简单地询问摘要是否事实正确,而是提出了一个不同的问题:当输入内容发生轻微变动时,摘要的稳定性如何?他们的方法基于这样一个理念:一个值得信赖的摘要生成器,即使在源文本发生微小且有意义的变化时,也应该产生一致的结果。如果摘要在经过细微修改后发生了剧烈变化,或者开始捏造新的细节,则表明该模型是不稳定的,且容易产生幻觉。研究人员构建了一个系统,该系统接收一份文档,在不改变核心含义的前提下对单词进行细微且受控的修改,然后观察 AI 输出的反应。通过测量原始摘要与新摘要之间的距离,他们可以计算出一个特定的分数,用以指示幻觉风险的严重程度。

为了进行这项实验,团队使用了一组涵盖三十四份文档的集合,涉及新闻文章、科学论文、法律文本和产品评论等多种主题。他们使用了一个先进的摘要模型为每份文档生成基准摘要。随后,他们引入了一系列“扰动”,即对源文本进行细小的、刻意的修改。这些修改经过精心设计,旨在将单词替换为其最接近的同义词,同时确保人名、地名和特定数字保持不变,以保留事实。针对每份文档,他们创建了多个版本的文本,每个版本都与原件略有不同,并要求 AI 对每个版本进行摘要。研究人员随后对比了生成的摘要,以观察它们偏离原件的程度。他们发现,当 AI 被迫总结略有改动的文本时,容易产生幻觉的模型生成的摘要会发生剧烈偏移,而可靠的模型则保持稳定。

研究人员利用一个数学概念来量化这种偏移,该概念通过衡量两组数据之间的差异,本质上是在计算摘要含义移动的距离。他们发现,这种不稳定性的度量并非随机波动,而是与 AI 撒谎的程度紧密相关。为了使这一度量在不同类型的文档中都具有实用性,他们对分数进行了归一化处理,从而创造出一个最终的严重程度分数,使其无论是在讨论医学还是电影时,都能进行公平的比较。最显著的发现出现在他们观察 AI 如何解释其自身选择时。他们使用了一种能够突出显示输入词汇对生成输出贡献度的技术。他们发现,当摘要产生幻觉时,输入词的重要性会发生不可预测的跳跃。换句话说,就在模型开始撒谎的那一刻,其内部推理变得不稳定了。

研究表明,模型推理中的这种不稳定性与幻觉的严重程度之间存在强关联。当研究人员将他们的新型严重程度分数与其他常见的错误检查方法进行对比时,发现模型内部解释的不稳定性是预测幻觉最可靠的指标。传统的检查方法(仅检查单词是否匹配或句子逻辑是否通顺)在捕捉这些深层错误方面效果较差。团队还测试了该方法在不同难度水平下的表现。他们发现,随着他们对文本进行的修改幅度增大,严重程度分数也随之上升,证明该系统足以检测到细微的可靠性变化。此外,该分数在不同领域之间呈现出自然的差异:法律和科学等复杂领域显示出比社交媒体帖子更高的不稳定分数,反映了这些领域更高的难度和更高的错误风险。

这项工作为审视人工智能的可靠性提供了一个全新的视角。通过关注模型对微小变化的反应而非仅仅关注最终输出,研究人员识别出了一个清晰的信号,可以判断 AI 何时正在失去对真相的掌控。研究表明,检测幻觉的最佳方式不是寻找谎言本身,而是观察其推理过程中出现的震颤。尽管研究人员是在特定的文档集和单一类型的 AI 模型上进行的测试,但该框架提供了一条稳健的前行路径,用于构建可审计且可信赖的系统。它将讨论从简单的“这是真的吗?”转向了“我们能在多大程度上确定这是真的?”,为衡量我们对机器生成文本的信任程度提供了一种定量化的方式。随着这些系统日益融入我们的日常生活,能够区分稳定、真实摘要与脆弱、虚假摘要的工具,对于维护我们所依赖的信息完整性将至关重要。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →