Cross-lingual Biography Enrichment via Claim Extraction and Alignment
本文介绍了 CLAW-4L 基准测试以及一种基于断言的框架,旨在利用来自非英语版本(法语、中文和阿塞拜疆语)的局部落地事实来丰富英文维基百科中的女性传记,并证明了尽管在低资源环境下存在挑战,跨语言对齐仍能提高覆盖率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
维基百科是世界上最受欢迎的百科全书,是一个由志愿者在几乎所有语言中共同构建的庞大图书馆。然而,这个图书馆并不完全平衡。虽然英语使用者可以阅读数百万篇详尽的文章,但许多来自非英语背景的人在英语中的描述却远不够详细,尽管他们在各自的母语中有着充分的记录。这种差距为人工智能制造了一个盲点。现代计算机程序通过阅读和编写文本进行训练,而这些程序在很大程度上依赖于英语数据,这意味着它们对那些主要以法语、中文或阿塞拜疆语记录的丰富人生了解得较少。当这些程序尝试为这样一个人撰写传记时,往往只能写出一个单薄、不完整的版本,遗失了那些让此人生命变得独特且重要的细节。
一个研究小组致力于通过教导计算机如何从一种语言中借鉴传记的最佳部分并将其编织进另一种语言,来解决这种不平衡问题。他们专门针对女性这一群体——由于历史原因,该群体在百科全书中代表性不足——来测试是否可以利用法语、中文或阿塞拜疆语维基百科文章中的详细信息,来充实相应的英语版本。挑战不仅在于翻译缺失的词汇,还在于理解哪些事实是全新的,哪些是已知的,以及如何在不捏造虚假细节的情况下将它们结合起来。研究人员开发了一种新方法,其作用就像一位细心的编辑:首先将外语文本拆解为微小的、可验证的事实,将其与已知信息进行比对,然后仅使用这些新的、经证实的资料来扩展英语故事。
为了测试他们的想法,该团队创建了一个名为 CLAW-4L 的专门数据集,该数据集将 300 篇英文女性传记与其对应的法文、中文或阿塞拜疆语版本进行配对。他们发现,非英语版本通常要丰富得多,包含了关于受访者生活、职业和成就的数千个更多单词和数百个更具体的细节。研究人员随后建立了一个提取这些事实的系统。他们并没有将整个外语传记输入计算机程序进行阅读和重写(因为这会让机器因信息过多而产生困惑),而是先将外语文本分解为独立的陈述。例如,与其处理一段关于科学家职业生涯的长篇段落,系统会识别出具体的陈述,如“她领导了巴黎的镭研究所”或“她在 1911 年获得了诺贝尔化学奖”。
一旦事实被分离出来,系统就会将其与现有的英文传记进行对比。它扮演着严格的守门人角色:丢弃任何已存在于英文版本中的事实,但保留任何与之矛盾的事实以供潜在的协调。其目标是寻找“增补性陈述”——即那些存在于外语中但在英文中缺失的信息。这一过程至关重要,因为它防止了计算机只是简单地重复已知内容,或在冗长、无结构的文本中迷失方向。研究人员测试了三种不同的方法:直接将原始外语文本输入计算机;先将外语文本翻译成英文再输入;以及使用他们的新方法,即仅输入选定的、经过验证的事实。
结果表明,新方法最为有效。当计算机尝试阅读原始外语文本或直接翻译的内容时,它往往在增加新信息的同时也编造了并非真实的事实,这种问题被称为“幻觉”。相比之下,使用选定且经过验证的事实的方法,使计算机能够添加显著更多的准确细节,同时出错率极低。在测试中,该系统成功地为英文传记增加了新的、有据可查的事实,同时保持了虚假信息的生成率处于极低水平。这表明,将复杂的文本拆解为微小、易于管理的事实并在使用前进行检查,比单纯翻译整篇文档是更安全、更可靠的改进计算机生成写作的方式。
这项研究还强调,当源语言是像法语或中文这样资源丰富的语言时,这种方法效果最好;但对于像阿塞拜疆语这样数字资源较少的语言,情况仍然具有挑战性。在这些情况下,系统有时会遗漏有用的信息,因为最初的提取事实步骤不够准确。尽管存在这些局限性,但该研究展示了一条清晰的前行之路。通过将传记视为事实的集合而非待翻译的文本块,并对其进行验证和对齐,计算机可以学会讲述关于世界各地人们更完整、更准确的故事。这项工作表明,数字百科全书的未来不仅在于翻译更多的文字,更在于智能地连接存在于每种语言中的具体、经过验证的细节,从而勾勒出更完整的全人类历史图景。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。