← 最新论文
💻 computer science

ESLA: Empirical and Semantic Label Alignment for Multi-Source NER Transfer in Unlabeled Target Domains

本文介绍了 ESLA,这是一个结合了经验预测一致性和语义表示,旨在对齐多个源域中异构命名实体识别标签的框架,从而实现向无需目标侧训练监督的无标签目标域进行有效的跨域迁移。

原作者: Xiaobo Zhang, Congqing He, Ying He, Jian Peng, Dajie Fu, Tien-Ping Tan

发布于 2026-09-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Xiaobo Zhang, Congqing He, Ying He, Jian Peng, Dajie Fu, Tien-Ping Tan

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在能够阅读并理解人类语言的计算机世界中,存在着一个持久的瓶颈:对大量标注数据的需求。为了教会机器识别命名实体——例如人名、公司名或特定日期——研究人员必须为其提供数以千计的示例,并在这些示例中由人工手动识别并进行标注。这一过程既昂贵又缓慢,且需要深厚的专业知识,这使得在金融或医学等专业领域尤为困难,因为这些领域的文本虽然丰富,但经过标注的示例却十分稀缺。尽管研究人员已经为新闻或社交媒体等通用话题建立了庞大的标注文本库,但这些资源往往使用不同的标注系统。一个数据集可能将某种特定的实体称为“产品”,而另一个则称其为“创意作品”,第三个则可能完全忽略它。这些不一致性造成了一道墙,阻碍了计算机从现有的公共数据池中学习,使其无法将知识迁移到最需要的新的、未标注的领域。

为了打破这道墙,由张晓波(Xiaobo Zhang)领导的一个研究小组开发了一种名为 ESLA 的新方法,全称为“经验与语义标签对齐”(Empirical and Semantic Label Alignment)。他们的工作解决了将多个不匹配的数据集合并为一个统一训练资源的问题,且无需目标领域的任何标注示例。研究人员专注于中文,结合了三个不同的公共数据集:一个包含通用新闻和媒体,另一个包含来自在线文本的细粒度细节,第三个则取自社交媒体。这些来源各自使用着独特的一套标签和定义。目标是使对齐这些不同的系统,以便计算机可以同时从它们中学习,从而创建一个更强大的模型,能够理解一个全新的领域:财务报告。

ESLA 框架的核心是一个两部分的策略,用于决定来自不同数据集的哪些标签应被视为同一事物。第一部分观察数据的实际表现。研究人员在一个数据集上训练模型,然后在另一个数据集上测试它,以观察计算机的预测与第二个数据集中的人工标签匹配的频率。如果一个旨在寻找一个数据集中“公司”的模型,在另一个数据集中一致地识别出“组织”,那么系统就会识别出这两个标签之间存在着强烈的实际联系。这就是经验信号,即一种基于现实世界一致性而非仅仅是词典定义的度量。第二部分则观察单词本身的含义。利用先进的语言模型,该系统分析这些标签出现的上下文。它计算一个标签的“概念”在数学空间中与其他标签的接近程度,确保“电影”和“书”在语义上被理解为相似,即使它们在源文件中被标记得不同。通过融合这两种信号——数据表现的方式和单词的含义——系统构建了一张连接不同数据集的地图。

然而,简单地合并数据是危险的。如果研究人员强行将联系松散的标签组合在一起,可能会导致模型产生困惑并降低其性能。为了防止这种情况,团队引入了一个稳定性检查。他们将合并过程视为一个优化问题,寻找能够实现最多标签合并,同时确保模型在原始数据上的准确率不会显著下降的具体规则组合。他们还解决了一个常见问题,即一个数据集可能拥有某种特定类型的数字标签,而另一个数据集则缺乏该标签。系统并没有忽略这些缺失的类别,而是利用拥有这些类别的知识来生成“伪标签”(pseudo-labels),从而填补空白,使模型能够从完整的图景中学习。

该方法的成果通过在合并后的中文数据集上训练统一模型,并在一个名为 FinReportNER 的金融基准测试(包含半导体公司年报文本)上进行评估来验证。至关重要的是,金融数据从未被用于训练模型或调整对齐,它仅作为测试系统如何泛化到新领域的最终测试。研究发现,ESLA 方法成功对齐了三个源数据集中的十五种不同标签类型,创建了一个保持高准确率的统一语料库。当在财务报告上进行测试时,用此合并数据训练的模型实现了 0.59 的 Macro-F1 分数,优于在任何单一源数据集上训练的模型,也优于在未进行对齐的直接组合数据上训练的模型。

这种提升在特定类别中尤为显著。例如,该模型在财务报告中识别“产品”的能力大幅跃升,达到了 0.06 的分数,这是单一源模型最佳结果的三倍。同样,对“时间”实体的识别能力提高到了 0.89,超过了所有其他配置。这些增益表明,通过仔细对齐人类标注信息的不同方式,系统学习到了更丰富、更灵活的实体理解。研究明确排除了“简单地将数据集粘贴在一起即可奏效”的观点;没有对齐的直接合并导致了仅 0.17 的低分,证明了对齐过程是必不可少的。此外,研究人员还展示了依赖人类专家或大语言模型来定义规则的效果不如其数据驱动的方法,后者能够发现人类观察者无法立即察觉的联系。

研究人员得出结论,只要目标领域没有可用的标注数据,他们的方法就能为跨领域任务提供一种可靠且自动化的重用现有数据资源的方式。虽然目前的系统在将许多细粒度标签合并为更宽泛的类别时效果最好,但研究也承认,它尚无法完全处理相反的情况,即一个宽泛的标签需要拆分为许多具体的标签。尽管如此,这项研究表明,通过结合经验证据与语义理解,可以构建一个统一的训练资源,从而显著提升在金融等专业领域的表现,将碎片化的公共数据转化为机器学习的强大工具。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →