Rater choice determines measured fidelity: a multi-model evaluation of large language model raters for AI-generated plain-language biomedical summaries
这项研究表明,大语言模型评分者的选择显著影响了对 AI 生成生物医学摘要的忠实度和安全性合规性的测量结果,不同模型的误差率差异可达四倍,并导致对摘要质量得出截然不同的结论。
最近的一项研究旨在通过测试四种不同的人工智能模型来回答这个问题。研究人员同时也开发了生成摘要的工具,他创建了一个受控环境,以观察这些 AI “评委”是否能够可靠地发现错误。过程始于五十篇涵盖五种不同疾病的真实、经过同行评审的医学文章。一个旨在根据不同受众(如患者或专业人士)定制内容的摘要应用程序,将这些文章转化成了 200 个不同的通俗语言章节。目标是观察这些摘要是否忠实于原文。为此,四种不同的 AI 模型(每种都是不同类型的语言大模型)被要求使用完全相同的严格清单,对同样的 196 个摘要进行评分。这个清单锚定在源文本上,这意味着 AI 需要回答的每个问题都直接关联到原文中的特定事实,例如:“摘要是否提到了这一特定的副作用?”或“它是否正确说明了研究的局限性?”
结果显示出令人震惊的不一致性。当四种 AI 模型对相同的摘要进行评分时,它们并不一致。事实上,它们对错误数量的测量差异达到了四倍。其中两个模型非常严格,在文本中发现了大量错误;而另外两个则要宽松得多,经常发现几乎没有任何错误。这种差异如此巨大,以至于它比所讨论的疾病类型或摘要的预期受众更为重要。其中一个模型甚至发现,超过一半的摘要完全没有主要错误,而最严格的模型则发现几乎每一个摘要都存在错误。这种分歧并非随机噪声;它指向了模型运作方式中的一个特定缺陷。那些宽松的模型似乎只检查了摘要中“已经存在”的内容,却忽略了那些“本该存在却缺失”的内容。它们未能察觉到关键的安全警告或研究局限性被完全遗漏的情况。
这种未能检测到缺失信息的现象对患者安全有着严重的影响。该研究重点关注了“安全性关键性的遗漏”,例如关于哪些人不应服用某种药物,或可能出现哪些危险副作用的警告。在源文章中,有 28 个章节包含至少一条安全声明。最严格的 AI 模型发现,其中 22 个摘要遗漏了该安全信息。然而,最宽松的模型仅发现了 4 处此类危险遗漏。当研究人员将 AI 的结果与一名对相同摘要样本进行评分的人类专家进行对比时,模式变得清晰可见。人类专家的错误率介于严格型和宽松型 AI 模型之间。严格的 AI 模型与人类的判断高度吻合,而宽松的模型则一致地漏掉了人类发现的一半以上的错误。这表明,依赖宽松的 AI 来检查安全性可能会带来一种虚假的安全感,导致危险的摘要在未被察觉的情况下通过质量关卡。
研究还揭示了一个隐藏的技术问题,使情况变得更加复杂。在测试期间,一些 AI 模型未能返回任何答案,而是发送了空响应。在用于该研究的计算机代码中,这些空响应被错误地视为完美得分,仿佛模型已经阅读了文本并认为其无懈可击。当研究人员重新运行这些特定的测试时,他们发现许多“完美”得分实际上只是模型放弃处理后的沉默失败。即使在考虑了这些失败情况后,结论依然没有改变:宽松的模型在系统性地低估错误。研究结论认为,并不存在所谓的“通用可靠 AI 评委”。一个在某一任务或某一类文本中表现良好的模型,在处理另一类内容时可能会完全失效。验证 AI 是否可以用于检查医学摘要的唯一方法,是针对其将要评估的具体内容类型,根据人类标准对其进行测试。如果没有这种验证,选择哪种 AI 作为评委,将会改变关于一份摘要是否安全可靠的最终结论。
技术摘要:评测者选择决定测量保真度
问题陈述 大型语言模型(LLMs)正越来越多地被用于为患者和公众生成生物医学研究的通俗语言摘要。虽然这些工具提供了可扩展性,但也带来了抽象概括错误的风险,例如遗漏安全警告、误述研究结果或删除限定性语言(hedging language)。为了降低这些风险,研究人员提出使用 LLM 作为自动化评测者来验证摘要的准确性。然而,目前存在一个关键空白:在应用相同的、基于来源锚定的分解式量表时,不同的 LLM 评测者是否会对准确性产生一致的评估,这一点尚不明确。现有研究通常依赖单一评判者,导致无法检测出评测者之间的分歧或系统性偏差。本研究旨在探讨自动化评测系统是否可以作为 AI 生成健康摘要的质量门控。
方法论 本研究利用作者开发的 Web 及 iOS 应用程序 ResearchUnlocked 来生成通俗语言摘要。