Ontology-Driven Structural Regularization for Document-Level Relation Extraction
本文引入了一种由本体驱动的结构正则化框架,该框架能够识别并缓解远程监督数据集中的逻辑不一致性,从而显著提升文档级关系抽取模型的泛化性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人类语言那浩瀚且无结构的海洋中,计算机难以寻找到那些将词汇集合转化为知识图谱的隐藏联系。为了构建一个机器可读的百科全书(即知识图谱),研究人员必须教会计算机阅读整篇文档,并识别出其中提到的所有人、地点和事物之间的每一项关系。这项任务被称为文档级关系抽取,它是能够回答复杂问题或推荐产品的系统的基础。然而,教导这些系统成本高昂,因为这需要人类手工细致地标注每一个连接。为了解决这个问题,科学家们转向了“远程监督”(distant supervision)方法,这种方法通过将文本与现有数据库进行匹配,来自动创建大规模的训练数据集。虽然这种方法生成了数百万个示例,但它以噪声著称,因为自动匹配过程并不完美,经常会导致计算机学习到错误的实事。
帕多瓦大学的一个研究小组发现,这些噪声数据集的问题不仅在于错误的事实,其数据本身的结构也是破碎的。他们发现,自动生成的“三元组”(即连接主语、关系和宾语的陈述句)经常违反基本的逻辑规则。例如,计算机可能会被教导某人出生于一个年份,或者一个城市是另一个城市的首都,这些矛盾现象违背了系统试图学习的基本逻辑。研究人员认为,这些结构性的不一致是导致训练过程受损的一个关键且被忽视的误差来源,它们会导致模型养成坏习惯,即使在测试干净数据时,这些习惯依然会持续存在。
为了解决这个问题,该团队开发了一个框架,其作用类似于这些数据集的“逻辑编辑器”。他们使用了一套正式的规则系统——类似于语言的语法,但应用于事实的结构——来扫描数百万个自动生成的示例。他们寻找特定类型的错误:实体与关系不匹配的三元组、缺失本应存在的逻辑反向连接,以及当关系只能单向存在却出现在双向时所产生的不可能的矛盾。当他们将这种扫描应用于名为 DocRED 的大规模远程监督数据集时,发现其中存在惊人的结构性噪声。该自动化数据集中的无效事实是人工标注版本的近三倍,缺失的反向连接是其近五倍,逻辑矛盾的数量也是其两倍。
随后,研究人员采取了果断的一步,以观察修复这些结构缺陷是否真的能帮助计算机更好地学习。他们并没有试图手动纠正每一个错误(这在如此规模下是不可能的),而是构建了一个清洗流水线,仅仅移除任何违反逻辑规则的数据点。他们剔除了有问题的示例,并在逻辑明确要求的地方添加了缺失的反向连接。接着,他们利用这些清洗后的数据训练了两个最先进的计算机模型,并将结果与使用原始混乱数据训练的模型进行了对比。结果非常明确:使用结构一致数据训练的模型犯下的逻辑错误要少得多。不可能出现的预测数量显著下降,且模型在理解关系方向方面变得更加出色。
或许最重要的一点是,这种结构清洗不仅让模型更具逻辑性,还让它们更准确。在标准基准测试中,使用清洗后数据训练的模型在寻找正确关系的能力上表现出了持续的提升。这项研究表明,通过在训练开始前强制执行基本的结构完备性标准,研究人员可以释放大规模自动化数据集的全部潜力。这种方法提供了一种利用远程监督规模优势而不被其固有噪声所限制的新途径,证明了有时教导机器的最佳方式,是确保它所学习的教训符合逻辑常理。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。