Validation of Large Language Models in Healthcare: a Scoping Review
本范围综述通过按任务和评估类型对现有的大语言模型医疗验证方法进行分类,旨在为利益相关者在临床实施前选择合适的策略提供一个结构化框架。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代医学领域,一种新型工具已经出现,它能够阅读庞大的医疗记录库,回答关于症状的复杂问题,并以人类无法企及的速度起草患者信函。这些被称为大语言模型的工具是人工智能的一种形式,通过海量文本进行训练。它们并不只是从数据库中检索事实,而是生成新的句子,将信息编织在一起,创造出听起来自然且具有人性化的响应。虽然这项技术有望减轻医生的行政负担并帮助患者理解其护理情况,但它也带来了显著的风险。由于这些模型是在“创造”文本而非仅仅“召回”文本,它们有时会捏造听起来看似合理但完全错误的事实,这种现象通常被称为“幻觉”。它们还可能反映出训练数据中存在的偏见,从而导致不公平或有害的建议。在这样一种强大的工具被信任并应用于医院或诊所之前,必须对其进行严格测试,以确保其安全、准确且公平。
荷兰乌得勒支大学医学中心的一个研究小组致力于绘制这些模型目前是如何被测试的图景。他们对科学文献进行了全面的回顾,以寻找所有用于验证医疗领域大语言模型的方法。该团队研究了从2005年到2024年晚些时候发表的研究,寻找描述如何检查这些人工智能系统质量的论文。他们专注于这些模型最有可能应用的五个特定任务:通用文本生成、长文档摘要、回答问题、从文本中提取特定医疗细节,以及作为聊天机器人之类的对话代理。在筛选了数千篇潜在研究后,他们确定了266篇提供了具体评估方法的论文。
研究人员将这些验证方法归纳为三种主要途径。第一种是人工评估,即由人类阅读人工智能的输出,并根据正确性、相关性或语气等标准判断其质量。这通常被认为是“金标准”,因为人类比机器更能理解细微差别和语境。第二种方法是带有真人参考的自动评估,即计算机程序将人工智能的答案与人类撰写的完美答案进行比较,测量两者的匹配程度。第三种是全自动评估,即由计算机在没有任何人类编写的示例进行对比的情况下,独立判断输出质量。研究发现,尽管存在许多方法,但它们往往是分散的,并且针对特定任务。例如,检查一个摘要是否优秀所需的工具,与检查一个聊天机器人是否礼貌所需的工具是不同的。
最重要的发现之一是,简单的表面检查是不够的。该综述强调,仅仅计算人工智能答案与参考文本之间单词重叠程度的方法往往具有误导性。这些传统的指标无法捕捉到含义是否正确,或者信息对患者是否安全。相反,研究人员发现正向着更复杂的技术转变。这包括检查人工智能的陈述是否在事实层面与源材料保持一致的方法,以确保它不会捏造医疗事实。还有一些工具旨在测试人工智能在以略微不同的方式提出相同问题时,其表现是否具有一致性,或者它对待不同背景的人群是否公平。该综述强调,对于医疗保健这类高风险领域,单一的分数通常是不够的。一个稳健的验证策略通常需要结合多种方法,同时检查准确性、安全性、公平性和清晰度。
作者还指出了当前实践中的一个重大差距。虽然许多研究提出了新的测试模型的方法,但缺乏专门针对医疗保健的标准化指南。许多现有方法是为通用语言任务开发的,可能无法捕捉到医疗错误的特定危险。该综述指出,仅依赖自动化工具是有风险的,因为它们有时会错过人类能发现的微妙错误。反之,仅依赖人类评判则既缓慢又昂贵。最理想的前进路径似乎是一种混合方法,即由自动化工具处理大部分检查工作,但由人类专家介入以验证结果,并确保模型符合医疗标准。
最终,这篇综述为任何希望在医学领域使用这些强大工具的人提供了路线图。它并不声称已经解决了验证问题,而是提供了一个目前可用工具的清晰清单。研究人员总结道,随着这些模型变得越来越普遍,医学界需要超越通用的测试,采用结构化的、针对特定任务的验证框架。通过了解每种评估方法的优缺点,开发者和临床医生可以更好地确保这些人工智能系统是可靠的患者护理伙伴,而不是不可预测的错误来源。这项工作强调,验证不是一次性的事件,而是一个持续的过程,对于将技术安全地整合进医疗保健这一微妙的生态系统中至关重要。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。