DOREMI: Optimizing Long Tail Predictions in Document-Level Relation Extraction
原作者: Laura Menotti, Stefano Marchesin, Gianmaria Silvello
原作者: Laura Menotti, Stefano Marchesin, Gianmaria Silvello
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
技术摘要:DOREMI —— 优化文档级关系抽取中的长尾预测
问题陈述
文档级关系抽取(DocRE)面临两个主要挑战:一是需要跨句上下文来识别关系,二是关系类型的严重长尾分布。在 DocRED 和 Re-DocRED 等标准数据集中,少量的频繁关系占据了训练数据的绝大部分,而大多数关系(长尾关系)的训练实例非常稀缺(通常少于 100 个)。这种类别不平衡会导致模型偏向频繁关系,从而降低其准确识别稀有关系的能力。此外,现有的缓解距离监督(DS)数据中噪声的方法(如 UGDRE)往往无法专门解决长尾关系问题,或者依赖于会加剧偏差的大规模噪声数据。虽然大语言模型(LLMs)展现出了潜力,但目前在处理这一特定任务时,其表现仍逊于最先进的序列模型。
方法论:DOREMI 框架
作者提出了 DOREMI(DOcument-level Relation Extraction optiMizing the long taIl),这是一个迭代的、人机协同的框架,旨在通过极少量的针对性人工标注来增强代表性不足的关系。与以往依赖启发式过滤或大规模 DS 数据的去噪策略不同,DOREMI 通过主动选择最具信息量的样本,来提高训练效率和鲁棒性。
该框架通过以下计算模块运行:
- 核心模型集成: DOREMI 维护一个由 n 个多样化 DocRE 核心模型组成的池(Γ)(具体包括 CNN、LSTM、BiLSTM、ContextAware 和基于 BERT 的模型)。这些模型最初在可用的专家标注(HA)数据上进行预训练。
- 分歧计算: 模型在噪声 DS 数据集上预测关系。对于每个实体对 (s,o),系统计算模型之间的分歧(ϕΓ)。分歧的计算基于模型是全部预测存在关系还是全部预测“无关系”的概率。为了处理 DocRE 的多标签特性,总分歧度是通过各关系分歧的乘积推导而来的。系统应用了对数变换以放大微小差异并增强可解释性。
- 迭代采样与标注: 系统通过选择分歧得分最高的 top-k 个实体对来识别“难分类”样本。至关重要的是,这种采样被限制在候选长尾三元组(即至少有一个模型预测为长尾关系的三元组)中,以确保标注工作能够针对特定的性能瓶颈。
- 标签聚合: 一旦达到停止条件(平均分歧降至阈值 ϵ 以下,或耗尽标注预算 b),系统将预测结果进行聚合以构建去噪距离监督(DDS)数据集。系统应用了一个面向精确率的过滤器:只有当至少有一个模型以高置信度(高于阈值 τ)预测该关系时,该关系才会被保留在最终的 DDS 中。
- 迭代训练: 被选中的样本会被人工标注,并添加到训练池中,随后对核心模型进行微调以扩展数据集。此循环重复进行,直到满足停止条件。
核心贡献
- DOREMI 框架: 引入了一种专为长尾关系设计的创新迭代系统,通过分歧驱动的标注来增强距离监督数据集。
- 分歧作为代理指标: 证明了衡量多个模型之间的分歧是识别 DocRE 中“难分类”样本的一种有效代理手段,能够以极低的人力成本带来显著的性能提升。
- 新数据集: 发布了两个基于 DocRED 和 Re-DocRED 的新型去噪距离监督数据集(DDS)。这些数据集专门针对长尾关系进行了优化,并且具有模型无关性,允许任何下游 DocRE 模型都能从改进的长尾覆盖率中获益。
实验结果
作者使用最先进的基线模型(ATLOP 和 DREEAM)在 DocRED 开发集和 Re-DocRED 测试集上对 DOREMI 进行了评估。
- DocRED: 仅标注 0.001% 的 DS 数据集(400 个三元组)就显著增强了模型性能。与领先的去噪技术(UGDRE)相比,DOREMI 将整体精确率提升了高达 +8.2%,将 F1 值提升了 +0.7%。对于长尾三元组(<100 个样本),精确率提升了 +76.0%,F1 值提升了 +5.0%。值得注意的是,对于训练中未见过的实体对涉及的长尾三元组,DOREMI 相比 UGDRE 将忽略 F1 (ignF1) 提升了高达 28.7%,将忽略精确率 (ignPrecision) 提升了 137.6%。
- Re-DocRED: 在更大的 Re-DocRED 数据集上,标注 0.003%(1,200 个三元组)带来了 +16.2% 的长尾精确率提升和 +19.2% 的 ignPrecision 提升。对于“极端长尾”三元组(<100 个样本),与 UGDRE 相比,DOREMI 实现了 +83.2% 的精确率增长和 +207.9% 的 ignPrecision 增长,其 ignF1 增幅为 +33.5%。
- 混合方法: 一种结合了用于长尾关系的 DOREMI 和用于频繁关系的 UGDRE 的混合设置表明,DOREMI 能有效补充现有的去噪方法,从而进一步提升整体指标。
意义与主张
论文声称 DOREMI 为 DocRE 中的长尾偏差问题提供了一种可扩展且高效的解决方案。通过在其设计中优先考虑精确率而非召回率,DOREMI 确保了提取关系的可靠性,这对于下游知识库构建(KBC)任务至关重要。作者强调,该方法能以极低的人工标注成本(在 Re-DocRED 实验中约为 20 个标注小时)实现显著的性能增益。这项工作确立了基于分歧的主动学习是针对 DocRE 定制数据集以提高其在稀有关系上泛化能力的有效策略,这也是首次将此类方法应用于 DocRE。由此产生的数据集和方法论为训练具有增强长尾分布处理能力的任意 DocRE 模型奠定了基础。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。
每周获取最佳 NLP 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。