← 最新论文
💬 NLP

From Documents to Spans: Code-Centric Learning for LLM-based ICD Coding

该论文提出了一种名为“以代码为中心的学习”(Code-Centric Learning)的训练框架,通过将监督信号从长临床文档转向可扩展的短证据片段,有效解决了大语言模型在 ICD 编码任务中面临的代码覆盖不足、可解释性差及计算成本高昂三大挑战,显著提升了模型对未见代码的泛化能力与准确性,并使得小模型性能可媲美大型专有模型。

原作者: Xu Zhang, Wenxin Ma, Chenxu Wu, Rongsheng Wang, Kun Zhang, S. Kevin Zhou

发布于 2026-03-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Xu Zhang, Wenxin Ma, Chenxu Wu, Rongsheng Wang, Kun Zhang, S. Kevin Zhou

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文提出了一种让大语言模型(LLM)更聪明、更高效地给医疗病历“打标签”(即 ICD 编码)的新方法。为了让你轻松理解,我们可以把整个过程想象成**“招聘和培训一名超级病历审核员”**。

1. 背景:什么是 ICD 编码?

想象一下,医院里每天都有成千上万的病人,医生写下的病历(比如“病人发烧、咳嗽,肺部有阴影”)是长篇大论的。
ICD 编码就是要把这些复杂的病历,翻译成一套标准的“代码”(比如 J18.9 代表肺炎)。这些代码就像条形码,用于医保报销、统计疾病数据等。

  • 现状:以前靠人工医生去读病历、查代码本,既慢又容易累出错。
  • 尝试:现在大家想用 AI(大语言模型)来自动做这件事。

2. 以前的方法遇到了什么“三大拦路虎”?

虽然 AI 很聪明,但直接让它去读几万字的病历并打标签,有三个大问题:

  1. 见识太少(代码覆盖率低)
    • 比喻:就像让一个学生只背了 100 道题就去考 7 万道题的试。现有的公开病历数据里,只包含了很少一部分疾病代码。遇到没见过的病,AI 就懵了。
  2. 只会猜谜,不懂解释(缺乏可解释性)
    • 比喻:以前的 AI 像个“神棍”,直接扔给你一个答案:“这是肺炎”。但它说不出为什么。医生没法检查它是不是瞎猜的,也不敢信。
  3. 读得太慢(训练成本太高)
    • 比喻:让 AI 去读一本 100 页的病历书,再让它背下来,非常费时间、费电。而且病历越长,AI 越容易“晕头转向”。

3. 这篇论文的“独门秘籍”:以代码为中心的学习 (Code-Centric Learning)

作者想出了一个绝妙的办法,把“读整本书”变成了“读重点摘要”。

核心思想:从“通读全文”变成“抓重点片段”

作者认为,给病历打标签其实分两步:

  1. 找证据:在病历里找到支持某个诊断的那几句话(比如“肺部有阴影”)。
  2. 定代码:根据这几句话,确定对应的代码。

以前的做法:把整本病历扔给 AI,让它自己找证据、定代码。
作者的新做法(CCL)

  • 第一步:教它“找证据”
    不再给整本病历,而是直接给 AI 看一小段关键证据(比如“肺部有阴影”),然后问它:“这段证据对应什么代码?”
    • 比喻:就像教学生认字,不是让他读整本《红楼梦》,而是直接给他看“林黛玉”三个字,告诉他这是个人名。这样学得快,记得牢。
  • 第二步:教它“看全局”
    用极少量的完整病历(只有 200 份),教它如何把分散的证据拼起来,最后给出一个完整的代码列表。

怎么解决“见识太少”的问题?(数据大爆炸)

既然公开数据里的代码不够多,作者就用 AI 自己“造”数据:

  1. 金矿(Gold):从官方权威的医学字典里,直接提取“症状 - 代码”的对应关系。这是最准的。
  2. 银矿(Silver):从现有的海量病历里,让大模型自动把“证据”和“代码”配对,虽然有点噪音,但数量巨大。
  3. 人造矿(Synthetic):对于字典和现有数据里都没有的“罕见病代码”,作者让 AI 发挥想象力:“如果一个人得了这个罕见的病,他的病历里通常会写什么?”然后合成出合理的证据片段。
    • 比喻:就像为了教学生认全 7 万个汉字,除了教他见过的,还让他根据偏旁部首去推测没见过的字长什么样,并编造例句。

4. 这种方法好在哪里?(三大优势)

  1. 快如闪电(效率提升 80%)
    • 因为大部分训练数据是“短片段”而不是“长病历”,AI 训练时间从 210 小时缩短到了 40 小时。就像从“读万卷书”变成了“背重点笔记”。
  2. 见多识广(泛化能力强)
    • 因为通过“人造矿”覆盖了几乎所有代码,哪怕是训练数据里从来没出现过的罕见病代码,AI 也能猜个八九不离十。在未见过的代码测试中,准确率提升了 5 倍多!
  3. 有据可查(可解释性)
    • AI 不再瞎猜,它必须先“指出”病历里的哪句话是证据,然后才能给代码。
    • 比喻:以前 AI 是“蒙面枪手”,现在它是“带证据的侦探”。医生可以检查它指出的证据对不对,如果不准,医生可以修正,人机协作非常顺畅。

5. 总结

这篇论文就像给 AI 医生开了一门**“速成班”**:

  • 不再死记硬背整本病历,而是精读关键证据片段。
  • 不仅学现有的,还通过逻辑推理自己创造没见过的病例知识。
  • 结果:用很小的模型(比如 8B 参数),就能达到甚至超过那些几百亿参数的大模型的效果,而且快、准、还能说出理由

这就好比,以前我们要培养一个全科医生,得让他读遍所有医书(耗时耗力);现在的方法,是给他一本**“精华考点手册”**,让他先掌握核心逻辑,再让他去处理复杂的病例,效果反而更好,还能随时向导师(人类医生)汇报他的推理过程。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →