Decomposing Error and Style in Automated Clinical Coding
本文认为,自动化临床编码中很大一部分归因于模型误差的性能差距,实际上源于未被建模的系统性编码风格,并证明了通过将模型显式地基于编码员特定风格指南进行约束,可以显著提高准确性并解决不同评估方法之间的差异。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
每当患者离开医生诊所或医院时,一项关键的行政工作便开始了。医疗编码员必须阅读医生编写的临床记录,并将其转化为一套标准化的字母数字代码。这些代码向保险公司和政府项目准确说明了患者出了什么问题以及采取了哪些治疗措施,从而决定了医疗机构能获得多少报酬。几十年来,自动化编码领域一直将这项任务视为一种简单的匹配游戏:计算机程序读取记录,如果其生成的代码列表与人类专家创建的单一“金标准”列表不完全匹配,该程序就会被判定为错误。这种方法假设,如果两名专家阅读同一份记录并遵循相同的规则,他们会产生完全相同的代码列表。
然而,在现实世界的医学领域,这一假设并不成立。即使是训练有素的人类专家,在查看完全相同的患者记录并使用相同的官方指南时,也经常会产生不同的代码列表。他们可能会在是否包含次要病症、诊断的具体程度,或者是否添加讨论了但未执行的服务相关的行政代码等方面产生分歧。长期以来,研究人员认为这种分歧仅仅是人为错误——是拥有一个包含数万种可能代码的庞大系统所带来的混乱且不可避免的成本。但一项新的研究表明,这种看似错误的情况实际上是另一回事:它是一种系统性的风格差异。正如两位作家可能会以不同的细节程度或侧重点来描述同一事件一样,两位编码员在应用关于什么值得记录以及需要多少证据来证明其合理性方面,也持有不同的内部政策。
亚马逊的一支研究团队致力于调查这一差距,探讨编码员之间的分歧究竟是随机噪声,还是可以测量并利用的预测模式。他们首先研究了一个由两个独立团队进行编码的 110 份患者就诊记录的公开数据集。尽管处理的是完全相同的记录,这两支团队对代码的达成一致率仅为 73%。当研究人员引入第三个独立的临床审计小组来审查记录并删除任何明显不合理的代码后,一致率仅略微上升至 77%。这意味着即使在剔除了明显的错误之后,仍有四分之一的代码存在专家间的差异。研究人员假设,剩下的这一差距并非知识层面的失败,而是一种“编码风格”的差异——即每个编码员或医疗机构所持有的特定偏好,涉及编码的激进程度、具体程度以及证明代码合理性所需的文档要求。
为了验证这一想法,研究人员构建了一个能够衡量这种风格的系统。他们创建了一个包含十个不同维度的简单量表(或检查清单)。其中一些维度提出的问题包括:“编码员是仅列出主要投诉,还是列出提到的每一个问题?”或者“编码员是否根据提到的药物推断出某种状况,还是等待医生明确说明诊断?”他们利用大语言模型分析了数百份患者记录及其对应的代码列表,以此为每组数据在十个维度上进行评分。这个过程为每个编码组创建了一个“风格剖面”(style profile),本质上是将他们的集体习惯总结为一组描述其处理方式的数字。
突破点在于研究人员利用这些风格剖面来引导计算机模型。他们不再只是要求计算机“编码此记录”,而是添加了一个特定的指令块,用以描述试图模仿的编码员的风格。例如,如果目标风格是“激进型”,计算机就会被告知要列出文本中提到的所有可能状况;如果风格是“保守型”,则会被告知仅列出明确确认的内容。结果令人瞩目。当计算机获得的风格剖面与其试图编码的数据相匹配时,其准确性大幅提升。在几个数据集中,计算机的表现根据标准评分量表提高了多达 26 个百分点。相反,当计算机获得的风格剖面与数据发生冲突时——例如,让一个保守型编码员表现得激进,或反之亦然——其表现则大幅下降了多达 21 个百分点。
这一发现表明,此前被归咎于计算机无法理解医学的许多问题,实际上是计算机未能理解编码员的习惯。研究人员在包括门诊访问和住院记录在内的五个不同数据集中测试了这一点,并发现无论采用哪种方法,该效应几乎都成立。无论是使用基础提示词还是复杂的、多步骤的流水线,添加正确的风格剖面都能持续提升结果。事实上,一个受正确风格指令引导的简单、未经训练的计算机模型,其表现与一个没有任何此类引导的高级预训练模型同样出色。这暗示着计算机已经掌握了医学规则,它只是需要知道在特定语境下应应用哪一个版本的规则。
研究还显示,这种“风格”是数据源的属性,而非随机噪声。当研究人员将不同医院和编码团队的风格剖面进行可视化处理时,他们看到这些剖面按来源进行了聚类。一家倾向于对诊断进行非常具体描述的医院,其剖面具有独特的特征,与倾向于使用更宽泛、较不具体代码的医院截然不同。这种聚类证实了风格是医疗机构运作方式的一种真实且可衡量的特征。然而,研究人员也指出,他们的十点检查清单并非完整的全景图。在涉及两支分歧率达 27% 的团队的一个特定案例中,该清单无法完全解释这种差异,这表明仍存在目前的工具无法观测到的隐藏风格维度。此外,该方法在处理住院记录时效果较差,因为每位患者庞大的代码量超出了他们设计的简单量表范围。
最终,这项工作重新定义了我们看待自动化医疗编码的方式。它表明,目标不应该是强迫每台计算机都去匹配一个单一、僵化的“金标准”列表,而是要承认不同的医疗环境在记录护理方式上存在合法的、系统性的差异。通过测量并适应这些风格,计算机可以变得更加准确。研究人员得出结论,人类与机器之间的差距不仅是智能或训练的问题,更是对齐的问题。如果我们能教会机器使用与人类编码员相同的文档“语言”,我们就能找回那些此前被认为已损失掉的大量准确性。这并不意味着计算机在猜测;这意味着计算机终于听从了正确的指令。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。