← 最新论文
💻 computer science

A Hybrid Semantic–Lexical Framework for Intelligent Data Quality Enhancement Using Ontology Reasoning and NLP-Based Validation

本文提出了一种结合了基于本体的推理与由自然语言处理驱动的词汇校验的混合语义-词汇框架,旨在显著增强异构文本数据集中的上下文异常检测与智能数据纠错,并通过在受污染的医疗数据上表现出的优于传统仅基于词汇方法的性能证明了这一点。

原作者: Ismail El Gayar, Hesham Hassan, Lamia Abo Zaid

发布于 2026-09-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Ismail El Gayar, Hesham Hassan, Lamia Abo Zaid

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代世界中,数据是驱动从医院记录到金融市场等一切事物的燃料。然而,这种燃料往往是肮脏的。正如汽车引擎会在受污染的汽油上熄火一样,当智能计算机系统被喂入不准确、不完整或令人困惑的信息时,它们也会失效。这个问题在文本领域尤为突出,因为一个简单的拼写错误或一个错位的词就可能改变一条记录的全部含义。传统的文本清洗方法依赖于检查明显的错误,例如缺失的数字或不符合严格列表的单词。然而,这些方法往往会忽略更深层次的问题,即单词拼写正确但在其特定语境下毫无意义。为了解决这一问题,研究人员正转向两种强大工具的结合:一种是被称为“本体”(ontology)的关于世界运作方式的结构化地图,另一种是计算机理解人类语言的能力,即“自然语言处理”。

一组研究人员开发了一种新系统,通过融合这两种方法来创造一种更智能的数据清洗方式。他们的研究成果发表在最近的一项研究中,介绍了一种混合框架,旨在检测并修复混乱的文本数据集,特别是医疗保健领域的文本。该系统不仅仅是在寻找拼写错误;它理解词语背后的含义。通过将定义医学概念之间关系的正式知识库与先进的语言分析相结合,该框架能够识别出旧方法会忽略的不一致之处。例如,它可以识别出患者的症状描述在语法上是正确的,但考虑到其已记录的其他病症,在医学逻辑上是不可能的。

研究人员使用了一组源自新冠肺炎(COVID-19)健康记录的数据集对该系统进行了测试,在这一领域,数据的准确性对于追踪疾病和做出救命决策至关重要。他们刻意在数据中引入了各种类型的错误,包括缺失值、拼写错误的医学术语以及语义混淆的条目,以模拟现实世界记录保存过程中发生的各类错误。随后,该系统被要求寻找这些错误并提出修正建议。与以往仅检查单词拼写是否正确或数字是否在一定范围内的模型不同,这个新框架会检查信息是否符合患者记录的整体叙述。它利用医学知识的结构化地图来理解某些症状属于特定的疾病,并利用语言分析来捕捉人类可能会忽略的细微拼写变化。

实验结果非常明确。混合系统表现显著优于仅依赖语言分析的方法。当研究人员在没有结构化知识图谱的情况下测试该系统时,它很难区分那些仅仅是罕见的词汇与那些在医学语境下确实错误的词汇。然而,一旦系统配备了本体,其检测真实错误的能力便大幅提升。在一次特定的测试案例中,在完全整合了知识图谱后,系统识别正确数据的准确率从60%上升到了96%以上。这表明,结合领域规则的理解与文本本身的分析,比孤立地使用其中任何一种方法都要有效得多。

研究还测量了该系统在多次运行时运行的稳定性。结果显示性能波动极小,表明该框架可靠且一致。它能够以高精度发现错误并提出修复建议,这意味着当它标记某条记录存在问题时,几乎可以确定是正确的。虽然该系统并未捕捉到每一个错误,但它所捕捉到的错误具有高度的可信度,降低了因误报而浪费人力时间的风险。研究人员指出,当底层的知识图谱完整且准确时,系统的效果最好,这凸显了用于清洗数据的知识质量决定了数据的质量。

这项工作代表了我们处理每天产生的海量文本数据方式的一次重大进步。通过教会计算机不仅理解单词,还理解单词之间的关系,研究人员创造了一个能够以以往仅限于人类专家水平进行数据清洗的工具。该框架在复杂且高风险的医疗环境中表现得尤为有效,因为在医疗领域,单个错误就可能产生严重的后果。研究结论认为,尽管该系统并不完美且依赖于其知识库的质量,但它为提高异构环境下的数据质量提供了一个可扩展且稳健的解决方案。随着数据在容量和复杂性上的持续增长,这类智能系统将成为确保驱动我们决策的信息尽可能洁净且可靠的关键。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →