Optimising Factual Consistency in Summarisation via Preference Learning from Multiple Imperfect Metrics
本文介绍了一种自动化训练流程,通过聚合多个不完美指标的分数来构建高质量偏好数据集,从而提升摘要的事实一致性,使不同规模的模型能够在无需复杂奖励塑造的情况下从细微的词汇差异中学习。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你有一位非常聪明但有时过于自信的学生(即人工智能语言模型),他擅长撰写流畅的故事,但偶尔会编造一些听起来真实却并非事实的内容。当这位学生被要求总结新闻文章时,这就成了一个重大问题,因为事实错误可能会产生误导。
本文提出了一种训练该学生变得更加诚实的新方法,而无需人类教师对每一份作业进行评分。以下是他们做法的简明解释:
1. 问题所在:“有缺陷的裁判”
通常,要训练人工智能,你需要一个“奖励信号”——一种能告诉它“做得好!”或“做得差!”的方式。
- 旧方法:研究人员曾尝试使用自动化工具(指标)来给人工智能的摘要评分。但这些工具就像不完善的裁判。一位裁判可能认为某份摘要很棒,而另一位却觉得它糟糕透顶。如果你只听信一位裁判,人工智能就会感到困惑;如果你试图手动将它们结合起来,过程会变得混乱,并需要大量的人工调整。
- 人类方法:你可以雇佣人类来评分,但这既昂贵又缓慢,而且人类有时会因为专注于故事听起来多么“悦耳”而忽略细微的事实错误。
2. 解决方案:拥有“否决权”的“裁判团”
作者创建了一个完全自动化的系统,它就像一个由三到四位不同裁判组成的裁判团。
- 设置:他们选取一篇新闻文章,要求人工智能撰写两份略有不同的摘要。他们确保这两份摘要看起来非常相似(就像同一篇文章的两个草稿),这样它们之间唯一的实质性差异就是其中的事实。
- 评分:他们将两份摘要分别通过多个不同的自动“事实核查工具”。
- 规则:只有当所有裁判都同意哪份摘要更好时,系统才会保留这一对摘要。如果裁判 A 说“摘要 1 更好”,而裁判 B 说“摘要 2 更好”,系统就会丢弃这一对。这作为一个过滤器,用于剔除“嘈杂”或令人困惑的数据。
- 训练:随后,人工智能从这些“达成一致”的配对中学习,理解即使是措辞上的微小变化也可能导致真实性的巨大差异。
3. “词汇相似性”技巧
为什么要让摘要看起来如此相似?
想象一下,你试图教某人区分红苹果和绿苹果。如果你给他们看一个红苹果和一辆蓝色汽车,他们可能会对你到底在教什么(颜色还是物体)感到困惑。
作者让人工智能生成的摘要在结构和词汇上几乎完全相同,从而迫使人工智能仅关注事实差异,而忽略风格或结构。
4. 结果:小模型迎头赶上
研究人员在多种不同的人工智能模型上测试了这种方法,从小型、较旧的模型到庞大、现代的“大型语言模型”。
- 令人惊讶之处:小型、较旧的模型(如 BART)学习得如此出色,以至于它们在事实准确性方面几乎达到了巨型、昂贵模型的水平。
- 权衡:摘要变得非常准确,但有时它们比其他方法生成的摘要略显不够“丰富”或详细。这就像人工智能决定:“为了确我不意外撒谎,我会略去额外的细节。”
5. 他们未做之事(重要局限)
- 他们没有使用人类教师来评分数据;所有工作均由计算机完成。
- 他们没有声称此方法适用于医疗建议或法律合同。他们仅在新闻摘要(XSUM)和 Reddit 帖子(TL;DR)上进行了测试。
- 他们指出,虽然人工智能在事实方面变得更好,但与由人类训练的摘要相比,其可读性有时略显“无趣”。
nutshell
这篇论文就像一条训练人工智能的工厂装配线。与其雇佣人类检查员检查每一件产品,他们建立了一个系统,由多个自动检查员检查工作。如果他们都同意产品合格,该产品就会被盖上“批准”印章;如果他们意见不一,该产品就会被回收。这使得即使是小型、较旧的机器(人工智能模型)也能在不依赖昂贵人工监督的情况下,生产出高质量、事实准确的作品。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。