← 最新论文
📄 health informatics

Towards understanding the disease landscape of clinical trials in Germany: Ontology and embedding-based pipelines versus Large Language Models for ICD-10 Harmonization

本研究表明,尽管确定性本体论和基于嵌入的流水线可以使德国异构临床试验条件数据在 ICD-10 标准下实现部分统一,但大语言模型(特别是 GPT-4o)通过实现与专家人工编码近乎完美的契合度,显著优于该方法,从而为跨注册库的疾病图谱分析提供了一种更优的解决方案。

原作者: Ndabashinze, R., Franzen, D., Kozuch, E., Aagerup, J., Fink, A., Yerunkar, S. S., Hunter, K., Mayo-Wilson, E., Ying, X., Kilicoglu, H., Schorr, S. G., Seidler, A. L.

发布于 2026-08-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Ndabashinze, R., Franzen, D., Kozuch, E., Aagerup, J., Fink, A., Yerunkar, S. S., Hunter, K., Mayo-Wilson, E., Ying, X., Kilicoglu, H., Schorr, S. G., Seidler, A. L.

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

想象一下,试图组织一个规模宏大的图书馆,其中的每一本书都用不同的语言编写,使用不同的字母表,有时甚至只有一张写着“关于某个病人的事”的便签而不是标题。这就是目前临床试验数据的现状。科学家们进行成千上万次实验来测试新药,但他们将这些试验注册在世界各地的不同数据库中。有些使用严格的医学代码,有些使用华丽的医学词典,还有些只是用普通的英语或德语直接写出来。这就像是在统计有多少人在研究“心脏问题”时,一个数据库说的是“心脏问题(cardiac issues)”,另一个说的是“心脏麻烦(heart trouble)”,而第三个干脆写着“哎哟,我胸疼”。如果没有一种方法将所有这些不同的描述转化为一种通用的语言,就很难看清科学家们究竟在研究哪些疾病,以及研究领域存在哪些空白。

为了解决这个问题,研究人员需要一位翻译官。在医学界,疾病的“通用语言”被称为 ICD-10,这是一份对所有已知健康状况进行分类的庞大列表。挑战在于如何将临床试验描述中那些混乱、杂乱的描述自动转化为正确的 ICD-10 代码。长期以来,科学家们一直试图构建计算机程序来充当严格的图书管理员,遵循一套死板的规则手册,将单词与代码进行匹配。最近,一种被称为“大语言模型”(LLM)的超智能计算机大脑进入了讨论领域。这些模型在海量文本上进行了训练,擅长理解上下文和细微差别,几乎就像一个能够读懂言外之意的人。大问题是:这些 AI 大脑能否比旧有的基于规则的系统更好地完成临床试验描述的翻译工作?

本论文直接深入探讨了这个问题,通过构建一个高科技流水线,将来自德国四个主要注册机构的临床试验描述翻译成标准的 ICD-10 代码。研究人员创建了一个“确定性流水线(deterministic pipeline)”,这是一种高级说法,指的是一个多步骤的机器人流程。首先,机器人提取疾病提及项。然后,它尝试使用严格的医学词典(本体论)和一个寻找相似含义的智能搜索引擎(嵌入)来进行匹配。他们甚至添加了第二个版本,通过对排名靠前的猜测进行重新排序,以观察它是否能找到正确答案。但他们并未止步于此。他们还测试了一个强大的大语言模型(GPT-4o),但带有一个转折:他们强迫这个 AI 遵循与人类专家完全相同的逐步逻辑和规则,仅仅是为了看看这个 AI 是否能成为一个比机器人更好的“图书管理员”。

结果对于这种老派的方法来说是一个令人震惊的消息。当他们用这个基于规则的机器人流水线去对比人类医学专家编写的“金标准”代码时,在寻找特定的三位字母代码时,机器人的正确率仅为 49% 左右。它在猜测大类(比如“心脏病”对比“肺部疾病”)方面表现尚可,正确率约为 59%,但在细节处理上却很吃力。机器人经常会被听起来相似的疾病搞混,或者无法在它的词典中找到正确的代码。

然而,大语言模型的表现则完全处于另一个量级。当同一个 AI 被赋予相同的规则和任务时,它达到了惊人的 96.7% 的准确率。它几乎完美地与人类专家保持一致。论文指出,AI 的超能力不仅在于了解这些代码,更在于其理解句子“上下文”的能力。例如,如果一项试验提到了“成年发病型糖尿病(adult-onset diabetes)”,AI 会立即知道这意味着“2 型糖尿病”,而机器人可能会卡在尝试匹配精确单词的步骤上。此外,对于机器人放弃并拒绝处理的提及项,AI 成功为其中约 82% 的内容分配了合理的代码。

作者发现,机器人的主要失败不在于对代码进行重新排序,而在于甚至无法找到正确的代码。如果正确的代码不在机器人的初始候选名单中,再多的重新排序也无法挽救。相比之下,AI 则更擅长弄清楚正确的代码“应该是”什么,即使文本非常混乱或模糊。该研究得出结论:虽然旧有的基于规则的系统在获取疾病趋势的大致轮廓方面还可以,但大语言模型在把握细节方面显然是胜出的。他们建议,未来研究临床试验格局的研究应该使用这些 AI 工具,以便获得更清晰、更准确的疾病研究图景,从而确保研究工作真正聚焦于最重要的健康需求。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →