← 最新论文
💬 NLP

Transformer Models for Text Summarization: A Comparative Study of BART, BERT, and RoBERTa

本文对基于 Transformer 的模型(具体为 BERT、RoBERTa 和 BART)进行了比较综述,通过分析其架构和预训练策略,以评估其在抽取式和生成式自动文本摘要任务中的适用性。

原作者: Daisy Aptovska, Vinayak Elangovan

发布于 2026-08-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Daisy Aptovska, Vinayak Elangovan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在这个信息传递速度快于阅读速度的世界里,将长篇文档提炼为核心要点的能力已成为一项至关重要的技能。这就是自动文本摘要的领域,这是一个致力于教机器如何阅读、理解并压缩人类语言的计算机科学领域。几十年来,研究人员一直试图通过教计算机要么从文本中挑选出最重要的句子,要么用全新的词汇重新改写内容来解决这个问题。第一种方法通常被称为“抽取式”(extractive),就像是在书中勾勒出最精彩的句子;第二种被称为“生成式”(abstractive),则更像是记者为不同的受众重写故事。最近,由一种被称为“Transformer”的结构构建的新一代计算机程序接管了这个领域。这些程序在海量文本上进行训练,以学习语言是如何运作的,从而使它们能够以惊人的速度和准确度完成这些摘要任务。

宾夕法尼亚州立大学的一个研究小组最近决定对比这一新一代中最受欢迎的三种程序:BERT、RoBERTa 和 BART。虽然这三者都基于相同的底层技术,但它们的设计具有不同的内部结构和训练方法,因此适用于不同类型的工作。研究人员想要准确了解这些差异如何影响它们总结新闻文章的能力。他们并没有发明新模型,而是将这三个现有模型置于严格的测试中,以观察在特定条件下谁的表现最好。为此,他们使用了一组真实的新闻故事以及随附的人类编写的摘要,这是此类研究的标准材料集。由于受限于计算能力,他们无法使用完整的、庞大的数据集,因此他们选择了一个包含 15,000 条故事用于训练、100 条用于测试的小规模且易于管理的样本。

实验揭示了这些模型在处理任务方式上的明显分歧。前两个模型 BERT 和 RoBERTa 的设计初衷是理解文本而非生成新句子。在本研究中,它们被用于执行抽取式摘要,这意味着它们必须直接从原文中识别并挑选出最重要的句子。第三个模型 BART 的构造不同;它拥有一个允许其从零开始生成新文本的结构,使其成为一个生成式摘要器。当研究人员进行测试时,结果显示,旨在进行生成的模型 BART 所产生的摘要比其他两个模型更接近人类编写的参考摘要。用该领域的术语来说,即衡量计算机输出与人类输出之间词汇和短语重叠程度的指标,BART 的得分要高得多。它在其主要衡量标准上获得了约 0.41 的分数,而表现最好的抽取式模型 RoBERTa 的得分仅约为 0.18。

研究还强调了两种抽取式模型之间的差异。RoBERTa 是原始 BERT 的一种精炼且更鲁棒的版本,在接受相同的训练时间和数据时,它始终优于 BERT。这表明,模型最初学习语言的方式与它如何应用于特定任务同样重要。然而,抽取式模型与生成式模型之间的差距要大得多。研究人员指出,虽然 BART 产生的摘要流动性更好且能更自然地捕捉含义,但在评估时,它处于并未针对该新闻数据集进行专门训练的状态,而另外两个模型则是经过针对性微调的。即便面对抽取式模型的这一优势,生成式方法在结果中依然占据了主导地位。

尽管生成式模型表现出色,但研究人员也指出了重要的权衡。创造新句子的模型 BART 非常擅长产生流畅且可读性强的文本,但它也带有“幻觉”风险,即它可能会为了让故事读起来更顺畅而捏造细节或轻微改变事实。相比之下,仅仅复制原文句子的抽取式模型则能保证事实的准确性,因为它们从不凭空捏造,但它们的摘要有时会显得断断续续或脱节。研究还承认,实验结果受到了设备限制的影响;他们在标准计算机处理器而非专门的高速芯片上运行实验,这限制了他们处理数据的量。

最终,这项工作证实了模型的架构决定了其优势。如果目标是通过提取关键句子来获得快速、事实安全的摘要,那么像 RoBERTa 这样的抽取式模型是一个强力的选择。但如果目标是产生一篇流畅、类人化的文档重写,那么生成式模型 BART 则远为优越,即使在没有针对特定数据进行额外训练的情况下也是如此。研究人员总结道,虽然这些工具功能强大,但选择哪种工具取决于你更看重严格的事实忠实度,还是自然语言的流畅度。随着该领域的发展,下一步很可能涉及在法律或医学等专业领域测试这些模型,在这些领域,流畅度与绝对准确性之间的平衡变得更加至关重要。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →