Generalistic or Specific Embeddings, Which is Better? An Empirical Study on Search for Clinical Coding in Non-English Languages
这项研究表明,通过在由大语言模型生成的合成多语言数据上进行微调的两阶段临床编码检索系统,其在非英语语言中的表现优于经过英语预训练的基准模型,为构建无需大规模原生生物医学预训练的特定领域医学检索器提供了一种可扩展的方案。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一名图书管理员,正试图根据顾客给出的一个非常简短、模糊的描述,找到他们所需的确切书籍。
在医学领域,这被称为临床编码(clinical coding)。医生写下一段简短的笔记,比如“摔倒后右膝疼痛”,计算机系统必须从一本巨大的百科全书(称为 ICD-10)中找到与这一特定情况完全匹配的唯一代码。
问题在于?这本百科全书规模宏大,且其中的书籍极其相似。
- 书籍 A:“右膝疼痛”。
- 书籍 B:“左膝疼痛”。
- 书籍 C:“右膝疼痛,剧烈”。
- 书籍 D:“右膝疼痛,轻微”。
如果你选错了,医院的账单就会出错,患者的病历也会不完整。
旧方法:“博学通才型”图书管理员
长期以来,研究人员尝试通过使用庞大的预训练 AI 模型(如 BioBERT 或 MPNet)来解决这个问题。你可以把这些模型想象成读过数百万本英文书籍的图书管理员。他们很聪明,但有两个大问题:
- 语言障碍: 由于它们主要是在英文上训练的,因此在处理西班牙语、加泰罗尼亚语或意大利语医学术方时会感到吃力。
- 过于宽泛: 它们擅长寻找通用主题(例如“膝盖疼痛”),但在识别那些微小且至关重要的差异(例如“左”与“右”或“剧烈”与“轻微”)方面表现得很差。
这些作者发现,仅仅使用一个“更大”或“更具医学性”的图书管理员并无帮助。事实上,当处理西班牙语医学笔记时,这些大型英文训练模型的表现甚至不如简单的关键词搜索(BM25)。
新方案:“专业导师型”系统
作者们(来自 TietAI)尝试了一种不同的方法。他们没有向 AI 输入数百万条随机的医学笔记,而是使用了一个超级聪明的 AI(大语言模型/LLM)来充当导师。
他们是如何分步骤构建这个系统的:
第一步:导师创建“模拟考试”
由于真实的医学数据很难获取(它是私密的且标注成本高昂),他们要求一个前沿 AI 生成一个合成训练集。
- AI 被赋予了一个特定的代码(例如“右膝剧烈疼痛”)。
- 它被要求写一段符合该代码的虚假患者笔记。
- 至关重要的是,它还被要求编写一些具有误导性的虚假笔记,这些笔记看起来很接近正确答案,但实际上是错误的(例如“左膝剧烈疼痛”)。
- 这创建了一份包含 19,500 个问题的“模拟考试”,专门设计用来教模型区分相似的代码。
第二步:两阶段搜索团队
他们构建了一个两人协作的检索团队:
侦察兵(双编码器/Bi-Encoder):
- 这是一个快速、轻量级的 AI。
- 它的任务是扫描整本百科全书,并提取出前 10 本可能正确的书籍。
- 它擅长寻找通用主题,但仍可能混淆“左”和“右”。
- 类比: 这就像一名侦察兵冲进森林,抓取了一把看起来像你描述的那种树木。
法官(交叉编码器/Cross-Encoder):
- 这是一个速度较慢、更细心的 AI。
- 它会将侦察兵找出的前 10 本书与患者笔记放在一起,进行并排对比阅读。
- 它会寻找微小的细节(严重程度、位置、时间),以选出那唯一完美的匹配项。
- 类比: 这是一位专家,他会检查侦察兵抓来的那一手树木,然后说:“不,那棵品种不对。这棵才是对的。”
结果:小数据,大胜利
论文在真实的西班牙语医学数据集(CodiESP 和 DISTEMIST)上测试了这个系统。
- 旧方法: 最好的公开模型仅能实现约 22% 的代码完全准确。
- 新方法: TietAI 系统在一个测试中实现了 71% 的代码完全准确,在另一个测试中达到了 78%。
核心要点:
这篇论文证明了你不需要海量的数据集或巨大的模型来解决问题。你需要的是高质量、特定化的训练数据。通过使用 AI 导师来创建一小套完美的“高难度练习题”(合成数据),他们教会了一个小型模型成为一名编码大师。
本文并未提及的内容
- 它并未声称该系统目前正在医院中用于向患者计费(尽管暗示了其潜力)。
- 它并未说明该系统目前适用于所有语言(它仅测试了西班牙语、加泰罗尼亚语、意大利语、葡萄牙语、法语和英语)。
- 它并未声称 AI 会取代医生;它是一个帮助寻找正确代码的工具。
总结比喻
想象一下试图在干草堆中寻找一根特定的针。
- 旧方法: 你使用一个巨大的磁铁(大型预训练模型)把整个干草堆都吸了上来,但你仍然得靠猜来确定哪根才是你要的那根。
- 新方法: 你使用一个智能机器人(LLM 导师)来制造一个定制的小型磁铁,它只吸引你需要的精确类型的针。然后,你使用放大镜(交叉编码器)来复核最终结果。
结果如何?即使你只使用了少量的训练材料,你也能更快、更准确地找到那根针。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。