← 最新论文
💻 computer science

A Multi-Criteria Decision Framework for Aggregating Ranked ICD-10 Code Suggestions from Large Language Models

本研究表明,应用多准则决策分析的排名聚合方法(特别是 Borda 计数法和倒数排名融合法)来整合多个大语言模型的输出,与使用单个模型或简单的投票方案相比,能显著提高自动化 ICD-10 临床编码的准确性和稳定性。

原作者: Ricardo da Silva Santos, Murilo Gleysson Gazzola, Paulo Marcelino Figueira, Adriana Gomes Luz, Rodolfo de Carvalho Pacagnella, Cristiano Torezzan

发布于 2026-08-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Ricardo da Silva Santos, Murilo Gleysson Gazzola, Paulo Marcelino Figueira, Adriana Gomes Luz, Rodolfo de Carvalho Pacagnella, Cristiano Torezzan

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图解决一个巨大的、混乱的拼图,而拼图的碎片就是医学诊断。在医疗领域,每一位患者的故事都需要被翻译成一个特定的代码,就像一种被称为 ICD-10 的秘密语言,以便医院能够追踪疾病并获得报酬。但这种语言规模宏大、复杂且规则繁琐。最近,被称为“大语言模型”(LLMs)的超级智能计算机程序学会了通过阅读医生的笔记来猜测这些代码。你可以把这些模型想象成一支才华横溢但风格各异的侦探团队。每位侦探都会查看同一个案卷,并给出他们自己的一份嫌疑人(代码)名单,按“可能性最大”到“可能性最小”进行排序。问题在于,有时侦探 A 认为嫌疑人 X 是罪魁祸首,而侦探 B 则坚信是嫌疑人 Y。如果你只听信其中一位侦探,你可能会出错。这正是“多准则决策分析”(Multi-Criteria Decision Analysis)这一领域发挥作用的地方。它本质上是关于如何将许多不同的意见融合在一起,以找到唯一的最佳答案的艺术,有点像陪审团结合各种证词来达成裁决。核心问题是:你该如何混合这些嫌疑人名单,使得最终形成的群体比任何单个侦探本身都要更聪明呢?

本论文探讨的正是一个这样的问题:它将每个 AI 模型视为一场关于正确医学代码的大选中的独立“投票者”。研究人员提取了 1,117 份用巴西葡萄牙语编写的真实产科(妊娠相关)医疗笔记,并要求五种不同的强大 AI 模型为每份笔记生成一份可能的代码排名列表。他们并没有仅仅从其中一个模型中挑选胜出者,而是测试了三种不同的方法,将所有的列表合并为一个“共识”列表。他们尝试了一种被称为“多数派投票”(Plurality Voting)的简单方法(即出现在最多列表顶端的代码获胜),以及一种更详细的方法——“波达计数法”(Borda Count,即根据代码在每一份列表中出现的位置的高低来获得积分,而不仅仅是看它是否位居榜首),以及一种名为“倒数排名融合”(Reciprocal Rank Fusion)的方法(该方法会给出现在顶部的代码极大的权重,但仍然会统计那些排名较低的代码)。

结果非常明确,且其简洁性令人惊讶。研究小组发现,将模型组合起来几乎总是比单独信任表现最好的单个模型效果更好。具体而言,“波达计数法”是其中的佼佼者。当研究人员观察前 3 个建议时(他们发现这是平衡准确性和覆盖率的“黄金点”),与表现最好的单个 AI 相比,波达计数法在宽泛类别层面的整体准确率提高了约 20%,在具体代码层面的准确率也提高了近 19%。这表明,倾听 AI 模型的“群众呼声”,尤其是关注一个代码在每个人名单中的位置,比依赖单一专家能创造出更可靠的决策。

然而,论文也排除了一些可能性。研究发现,最简单的“多数派投票”法(仅仅统计谁是第一名)并没有像那些考虑完整排名的更细致的方法那样有效。研究还表明,你不能无限制地在列表中增加建议的数量。虽然增加更多代码有助于捕捉更多真实的诊断(召回率),但最终会因为引入过多的错误猜测(精确度)而降低准确性。研究建议,“黄金数字”是 3;超过这个数字,决策质量就会开始下降。此外,作者指出,仅仅给“最强”的模型赋予更多权重并没有什么帮助;所有模型未经加权的简单组合,效果与复杂的加权组合一样好。

简而言之,本文认为,对于临床编码而言,最好的策略不是寻找一个完美的 AI 模型,而是让几个不同的模型进行投票,并使用一个尊重它们完整排名的系统。这种方法提供了一种实用且稳健的方式来改进医疗决策,而无需重新训练模型或窥探它们的“黑箱”。这些发现是基于真实数据和带有置信区间的统计测试,表明这种方法是处理混乱的医学编码现实的一种稳定且有效的方式。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →