← 最新论文
💻 computer science

Rater choice determines measured fidelity: a multi-model evaluation of large language model raters for AI-generated plain-language biomedical summaries

这项研究表明,大语言模型评分者的选择显著影响了对 AI 生成生物医学摘要的忠实度和安全性合规性的测量结果,不同模型的误差率差异可达四倍,并导致对摘要质量得出截然不同的结论。

原作者: Aditi Kishore¹

发布于 2026-08-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Aditi Kishore¹

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象这样一个世界:最重要的医学发现被锁在了一道由复杂语言构成的围墙之后。科学论文是为专家编写的,充满了技术术语和密集的数据,普通人根本无法解读。然而,对于试图了解自身病情新疗法的患者来说,这种障碍可能是危险的。如果他们读不懂研究报告,就无法了解治疗方案的风险、局限性或真正的益处。为了弥合这一差距,研究人员和监管机构越来越多地依赖“通俗语言摘要”——即针对大众编写的、对复杂研究进行的简短且简单的解释。随着医学研究量的爆炸式增长,手工编写这些摘要已变得不再可能。取而代之的是,强大的计算机程序,即大型语言模型,正被要求承担这项工作,在几秒钟内将晦涩的科学内容转化为易读的散文。但一个关键问题仍然存在:如果由计算机编写摘要,我们能否信任另一台计算机来检查其准确性?

最近的一项研究旨在通过测试四种不同的人工智能模型来回答这个问题。研究人员同时也开发了生成摘要的工具,他创建了一个受控环境,以观察这些 AI “评委”是否能够可靠地发现错误。过程始于五十篇涵盖五种不同疾病的真实、经过同行评审的医学文章。一个旨在根据不同受众(如患者或专业人士)定制内容的摘要应用程序,将这些文章转化成了 200 个不同的通俗语言章节。目标是观察这些摘要是否忠实于原文。为此,四种不同的 AI 模型(每种都是不同类型的语言大模型)被要求使用完全相同的严格清单,对同样的 196 个摘要进行评分。这个清单锚定在源文本上,这意味着 AI 需要回答的每个问题都直接关联到原文中的特定事实,例如:“摘要是否提到了这一特定的副作用?”或“它是否正确说明了研究的局限性?”

结果显示出令人震惊的不一致性。当四种 AI 模型对相同的摘要进行评分时,它们并不一致。事实上,它们对错误数量的测量差异达到了四倍。其中两个模型非常严格,在文本中发现了大量错误;而另外两个则要宽松得多,经常发现几乎没有任何错误。这种差异如此巨大,以至于它比所讨论的疾病类型或摘要的预期受众更为重要。其中一个模型甚至发现,超过一半的摘要完全没有主要错误,而最严格的模型则发现几乎每一个摘要都存在错误。这种分歧并非随机噪声;它指向了模型运作方式中的一个特定缺陷。那些宽松的模型似乎只检查了摘要中“已经存在”的内容,却忽略了那些“本该存在却缺失”的内容。它们未能察觉到关键的安全警告或研究局限性被完全遗漏的情况。

这种未能检测到缺失信息的现象对患者安全有着严重的影响。该研究重点关注了“安全性关键性的遗漏”,例如关于哪些人不应服用某种药物,或可能出现哪些危险副作用的警告。在源文章中,有 28 个章节包含至少一条安全声明。最严格的 AI 模型发现,其中 22 个摘要遗漏了该安全信息。然而,最宽松的模型仅发现了 4 处此类危险遗漏。当研究人员将 AI 的结果与一名对相同摘要样本进行评分的人类专家进行对比时,模式变得清晰可见。人类专家的错误率介于严格型和宽松型 AI 模型之间。严格的 AI 模型与人类的判断高度吻合,而宽松的模型则一致地漏掉了人类发现的一半以上的错误。这表明,依赖宽松的 AI 来检查安全性可能会带来一种虚假的安全感,导致危险的摘要在未被察觉的情况下通过质量关卡。

研究还揭示了一个隐藏的技术问题,使情况变得更加复杂。在测试期间,一些 AI 模型未能返回任何答案,而是发送了空响应。在用于该研究的计算机代码中,这些空响应被错误地视为完美得分,仿佛模型已经阅读了文本并认为其无懈可击。当研究人员重新运行这些特定的测试时,他们发现许多“完美”得分实际上只是模型放弃处理后的沉默失败。即使在考虑了这些失败情况后,结论依然没有改变:宽松的模型在系统性地低估错误。研究结论认为,并不存在所谓的“通用可靠 AI 评委”。一个在某一任务或某一类文本中表现良好的模型,在处理另一类内容时可能会完全失效。验证 AI 是否可以用于检查医学摘要的唯一方法,是针对其将要评估的具体内容类型,根据人类标准对其进行测试。如果没有这种验证,选择哪种 AI 作为评委,将会改变关于一份摘要是否安全可靠的最终结论。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →