← 最新论文
💬 NLP

A Grounded and Decomposed Framework for Relation-Level Hallucination Evaluation in Abstractive Summarization

本文引入了一个基于落地且具备依赖感知能力的框架,用于评估生成式摘要中的关系级幻觉,该框架以一种增强的提取算法和一个归一化的关系幻觉指数(RHI)为特色,将忠实度分解为可解释的组成部分,从而实现更稳定且具判别性的模型评估。

原作者: Praveen Kumar Katwe, Rakesh Chandra Balabantaray, Kali Prasad Vittala, Naman Kabadi

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Praveen Kumar Katwe, Rakesh Chandra Balabantaray, Kali Prasad Vittala, Naman Kabadi

原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在读一个由一位非常有才华、但带点恶作剧精神的机器人写的的故事。这个机器人是“抽象式摘要”(abstractive summarization)方面的专家,这只是一个高级说法,意思就是它能阅读一篇长文章,并用自己的语言写出一个简短、精炼的版本。它非常擅长听起来自然且流畅,句子流动得像河流一样。但问题在于,为了追求酷炫,这个机器人有时会编造事实。它可能会保留正确的人名,但把谁对谁做了什么搞混了。这就像一名新闻主播说:“总统签署了条约”,而实际的文件内容是“条约是由秘书签署的”。词汇都在那里,但真相被扭曲了。这被称为“幻觉”(hallucination),在人工智能领域,这是一个大问题,因为我们需要我们的摘要不仅要优美,还要真实。

长期以来,试图捕捉这些撒谎机器人的科学家们使用的是类似于检查购物清单的工具。他们计算机器人使用的词汇中有多少也出现在了原始文章中。如果机器人使用了“苹果”这个词,而原文也有“苹果”,那么它就会获得一分。但这就像是在不品尝菜肴的情况下,仅凭用了多少食材来评判一位厨师。你可以有一碗装满了原材料的生食,完美契合清单,但那仍然是一顿糟糕的餐点。旧工具擅长检查机器人是否记住了“名字”,但它们在检查机器人是否记住了这些名字之间的“关系”方面表现得很差。它们无法区分一个讲述真相的机器人和一个讲述了极其具有说服力的谎言的机器人。

这时,来自 IIIT Bhubaneswar 的研究团队及其行业合作伙伴介入了,他们带来了一副更锐利的眼镜。他们意识到,要抓住一个骗子,你不能只数单词;你必须理解故事的结构。他们构建了一个用于评估摘要的新框架,其作用就像是一个寻找“关系级幻觉”的侦探。与其问“你用了正确的词吗?”,他们问的是“你是否连接对了点?”

研究人员创建了一个名为**关系幻觉指数(Relation Hallucination Index, RHI)**的新评分系统。把原始文本想象成连接不同角色和事件的复杂线网。一个好的摘要应该保持这些线条完整。一个产生幻觉的摘要可能会剪断一根线,并把它系到错误的人身上。旧工具会错过这一点,因为角色(词汇)仍然存在。然而,新的 RHI 旨在追踪每一根线。它使用一个复杂的流程将文本分解为被称为“三元组”(triples)的微小构建块——基本上就是:主语(谁)、谓语(做了什么)和宾语(对谁)。

为了确保这些三元组准确无误,团队并没有仅仅使用基础的扫描器。他们构建了一个“感知依赖关系”的提取引擎。想象一下,这个引擎就像一个非常细心的编辑,它不仅阅读文字,还深入理解语法。它知道如何处理主语隐藏的棘手句子(例如被动语态,“球被扔了”变为“有人扔了球”)。它知道如何忽略仅仅是报告言论的词(如“他说……”)并专注于实际的事实。它甚至通过将词汇转换为其基本形式(将“running”变为“run”)来清理词汇,这样就不会因为不同的时态而感到困惑。这确保了当他们将机器人的摘要与原文进行比较时,他们是在进行苹果对苹果的比较,而不是苹果对苹果派的比较。

团队在一个庞大的数据游乐场上测试了这个新系统。他们使用了三种不同类型的各类新闻数据集:XSUM(包含非常短、高度创意的摘要)、XLSUM(包含来自许多国家和语言的新闻)以及 CNN/DailyMail 数据集(包含更长、更详细的故事)。他们让四个著名的 AI 模型——BART-large-CNNPEGASUST5-largeGPT-3.5——编写了 800 个不同新闻故事的摘要。他们还包括了一个“人类参考”摘要,以观察机器人能多接近完美的真人得分。

结果令人大开眼界。当使用旧的、计数单词的工具时,PEGASUS 经常看起来像是赢家,因为它使用了大量与原文相同的词汇。但当研究人员应用他们新的 RHI 分数时,情况发生了变化。BART 在保留事件真实关系方面得分最高,尽管它并不总是使用完全相同的词汇。GPT-3.5 虽然在某些方面表现良好,但也表现出了很多“关系插入变异性”,这意味着它有时会创造出原本不存在的新连接。研究发现,新的 RHI 分数在识别这些微妙的谎言方面比旧方法要好得多。

他们发现的最有趣的事情之一是,这个分数是“归一化”的。这意味着无论你是在看一个简短、精炼的摘要,还是一个长篇、详细的摘要,它都能很好地工作。他们将错误分解为不同的类别:模型做对的事、模型编造的事、模型遗漏的事以及模型弄错的事。通过观察这些部分,他们可以清楚地看到模型是如何失败的。例如,他们发现虽然有些模型擅长保留主要事实,但在处理否定陈述(如“公司并未破产”)时却表现得很差。

研究人员运行了统计测试以确保他们的发现并非偶然。他们发现模型之间的得分差异是显著的,这意味着新的 RHI 分数是一种可靠的方法,可以用来区分一个好的、真实的摘要和一个坏的、产生幻觉的摘要。他们还展示了他们的新方法优于旧的“实体幻觉指数”(该指数仅检查名字是否正确),因为它检查了这些名字之间的“动作”和“连接”。

最后,这篇论文表明,如果我们想要人工智能是值得信赖的,我们就必须停止仅仅计数单词,而是开始检查故事的逻辑。新的关系幻觉指数提供了一种实现这一目标的方法。它不仅告诉我们一个摘要听起来是否好听,它还告诉我们它所讲述的故事是否真实。作者希望在未来,这种评分方式可以被用于训练 AI 模型使其更加诚实,帮助它们明白,仅仅做到流畅是不够的——你还必须忠实于事实。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →