Evaluating Clinical Concept Extraction and Evidence-Bounded Terminology Linking: Multisite Model Comparison and Pilot Ablation Study
本文通过一项多中心试点研究评估了临床概念提取以及基于证据的术语链接,结果表明,尽管提取性能随匹配标准的不同而显著变化,但检索到的证据的存在情况会关键性地影响链接决策,且最初未匹配的术语往往代表的是合理的现有概念,而非真正的本体论新颖性。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
医院不断产生大量的书面记录,从医生描述患者症状到护士记录药物变更的变化。这些叙述蕴含着丰富的信息,但它们是以人类语言编写的,充满了缩写、地方俚语和多变的句子结构。为了让这些数据对研究有用,或帮助计算机理解患者的历史,必须将这些笔记翻译成标准化的代码。这个过程包含两个截然不同的步骤。首先,系统必须找到文本中重要的特定短语,例如疾病名称或医疗程序。其次,它必须将这些短语与一份医学术语总表进行匹配,就像图书管理员为一本书分配特定的索书号以便日后查找一样。如果系统猜错了代码,或者完全遗漏了某个短语,生成的数据可能会出现偏差,从而导致对患者护理或治疗结果的错误结论。
挑战在于,这种翻译并不总是那么直接。不同的人在被要求寻找医学术语时,可能会高亮显示句中略有不同的部分;而计算机往往难以判断一个短语是应该匹配到一个标准代码,还是属于需要添加到总表中的全新概念。一组研究人员致力于测试现代计算机系统处理这些任务的表现,特别关注了答案的质量是否取决于计算机所能看到的证据。他们想知道,当系统拥有所有必要信息时,是否能够可靠地将一个短语链接到标准代码,以及当这些信息被隐藏或缺失时会发生什么。
研究人员进行了三项独立的测试,以理清这些问题。在第一项测试中,他们要求五个不同的计算机程序扫描六十六份真实的、匿名化的医院笔记,并提取出医学短语。他们将计算机的工作结果与两名人类专家的笔记进行了对比。结果显示,衡量成功的方式会彻底改变结论。如果你要求计算机高亮显示的词汇必须与人类完全一致,那么计算机的表现会非常糟糕,匹配率不足五分之一。然而,当研究人员使用一种寻找具有相同含义(即使词汇略有不同)的短语的方法时,一致性显著提高。在这项测试中,表现最好的计算机系统大约能实现一半的正确含义匹配,而人类专家自己在精确措辞上的一致性仅为三分之一左右。这表明计算机并非无法理解文本,而是对于什么是“匹配”的严格规则过于僵化了。
在研究的第二部分,研究人员专注于决策过程。他们选取了五十六个特定的医学短语,并在三种不同条件下要求一个强大的语言模型将它们链接到标准代码。在第一种条件下,模型被提供了一个包含正确选项在内的完整候选列表。在第二种条件下,正确的匹配项被秘密移除,留下的是相似但不正确的选项。在第三种条件下,模型没有收到任何列表,必须依靠其内部记忆。当正确的匹配项可见时,模型正确链接了每一个短语。当正确的匹配项被隐藏时,模型拒绝猜测,正确地识别出它没有足够的证据来进行链接。当模型没有可以咨询的列表时,它仍然正确链接了大部分短语,但也犯了一些自信的错误,即在没有任何支持性证据的情况下将短语链接到了代码上。这证明了系统的链接能力完全取决于是否向其展示了正确的证据。
最后一项测试观察了那些此前未能匹配到任何标准代码的短语。研究人员提取了八十四个此类“未匹配”术语,并将其输入到一个旨在寻找隐藏联系的系统中。尽管这些术项已被标准数据库拒绝,但该系统为每一个术语都找到了一个合理的现有匹配。没有任何术语被标记为真正需要添加到医学词典中的新概念。这一发现表明,当计算机最初无法找到匹配项时,并不一定意味着该概念是全新的或独特的;它通常只是意味着系统需要更深入地搜索或使用不同的搜索方法。
研究得出结论,构建一个可靠的理解医学笔记的系统,需要将每个步骤视为一个独立的挑战。识别短语的能力、检索正确证据的能力,以及决定是进行链接还是推迟决策的能力,都是不同的技能。一个在某一领域表现优秀的系统,如果条件发生变化,可能会在另一领域失败。研究人员发现,当给予计算机完整的证据时,它们可以实现高准确度的术语链接;但当证据缺失时,它们倾向于停顿而非猜测,这是一种更安全的方法。他们还发现,许多被认为是“新”的术语实际上只是难以被发现,且初始匹配失败并不证明一个概念是新颖的。通过分离这些任务并理解证据如何影响决策,开发者可以构建出更加透明且不太可能在关键医疗环境中做出自信错误的系统。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。