← 最新论文
📄 medicine

Evaluating Methods for Assessing LLM-Translated Clinical Discharge Instructions: A Comparison of Automated Metrics, MQM-Based Evaluation, and Clinician Review

本研究比较了用于评估大语言模型(LLM)翻译的临床出院指导的自动化指标、基于多维度质量度量(MQM)的大语言模型评估以及双语临床医生评审,发现尽管这些方法捕捉到了质量的互补方面,但其较低的一致性强调了为了确保临床含义和术语准确性,进行针对性人工评审的持续必要性。

原作者: William Mundo, Shiyue Hu, Alexander L Lupi, Elizabeth Goldberg, Yanjun Gao

发布于 2026-08-22
📖 1 分钟阅读☕ 轻松阅读

原作者: William Mundo, Shiyue Hu, Alexander L Lupi, Elizabeth Goldberg, Yanjun Gao

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

当患者离开医院时,他们收到的出院指导不仅仅是一份任务清单;它们是专业护理与日常生活之间至关重要的桥梁。如果这些指令无法被理解,药物错误、错过随访预约以及病情恶化的风险就会大幅上升。对于以西班牙语为主要语言的患者来说,这座桥梁必须用他们的母语来搭建。几十年来,医院一直依赖人工翻译来确保这些文件的准确性,但人工智能的快速崛起提供了一种更快速生成这些翻译的新方法。大型语言模型——即那种可以写论文或回答复杂问题的同类技术——现在正接受测试,以观察它们是否能像人类专家一样,以同样的细致和精准度来翻译医疗文件。核心问题不仅在于机器能否翻译文字,而在于它能否翻译“意义”,尤其是当一个错误的词汇就可能改变患者对自身健康的理解时。

科罗拉多大学医学院的研究团队致力于通过测试人工智能如何将英文的出院指导翻译成西班牙语,来回答这个问题。他们不仅仅是要求计算机进行翻译;他们构建了一个严谨的实验,以观察不同的提问方式(prompting)会如何改变结果。他们从一个大型医学数据库中提取了二百份真实的、去标识化的出院指导,并将它们输入到三种不同的人工智能模型中。为了观察人类向机器说话的方式是否重要,他们使用了两种截然不同的提示方法。在第一种方法中,他们要求计算机扮演一名重症监护室的专家临床医生,负责翻译文本。而在另一种方法中,他们给出了一个非常简单的、字面上的指令,仅要求翻译单词,而不赋予任何角色或背景。其目标是观察将机器设定为医生,是否会比将其视为简单的单词替换工具,从而带来更好的医学翻译。

为了评判这些翻译的质量,研究人员采用了三种不同的方法,从不同角度审视文本。首先,他们使用了自动化计算机指标,这是语言技术领域的标准工具,用于计算翻译中与原文匹配的单词和短语数量。这些工具速度极快,可以处理数千份文件,但它们主要关注表层相似性。其次,他们使用了一个名为“多维质量指标”(MQM)的结构化框架。该方法将翻译分解为特定的类别,例如医学术语是否正确、语气是否适合患者以及语法是否自然流畅。他们让一个人工智能系统充当评委,针对这些类别对翻译进行评分。最后,也是最重要的一点,他们引入了人类专家。两位精通英西双语的医生对随机抽选的翻译进行了审查。他们使用相同的结构化类别进行评分,作为衡量高质量、安全翻译的“金标准”。

结果揭示了计算机认为的好与人类医生认为的好之间存在着令人惊讶的分歧。那些统计单词重叠率的自动化指标一致倾向于由简单、字面提示生成的翻译。当计算机被要求进行逐字翻译时,自动化得分更高,这表明输出内容更接近原始英文文本。然而,当研究人员查看结构化质量评分和人类审查时,另一幅景象出现了。由“临床医生”提示生成的翻译——即要求计算机扮演医学专家的模式——在风格和语气方面通常表现得更好,即使自动化计数工具给出的评分较低。这表明,过去用于衡量翻译成功与否的工具,可能无法捕捉到医院环境中最重要的细微差别。

当研究人员对比人工智能评委给出的分数与人类医生给出的分数时,发现两者的契合度低得令人惊讶。计算机和人类专家经常在翻译是否准确或医学术语是否正确的问题上产生分歧。机器与人类之间最高的契合度出现在格式和本地惯例等领域,因为这些规则是清晰且客观的。然而,在最关键的领域——如医学意义的准确性和语言对患者的适用性——机器和人类的看法经常不一致。甚至两位人类医生之间也并不总是达成共识,这凸显了评判医学翻译涉及一种难以自动化的、人类解读的过程。研究发现,虽然人工智能模型生成的翻译总体质量较高,但它们最挣扎的领域恰恰是那些需要深度理解临床背景的领域。

研究人员得出结论,没有任何单一的方法足以确保翻译医疗文件的安全性。自动化工具对于快速检查大批量文本很有用,结构化评分系统有助于组织评估工作,但两者都无法完全取代人类专家的判断。研究建议,最好的方法是采用分层式的方法:利用快速的自动化检查来过滤掉明显的错误,随后针对文本中最关键的部分进行人类临床医生的针对性审查。这种组合确保了人工智能的效率与保护患者安全所需的监督之间达到了平衡。这些发现提醒我们,在医疗保健这类高风险环境中,翻译文字的能力并不等同于传递关怀的能力,而人类的专业知识仍然是这一过程中不可或缺的一部分。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →