Context-Window-Mediated Corruption of Large Multimodal Models in Clinical Medicine: A Systematic Review
这项针对十项高偏倚风险研究的系统综述表明,临床医学中的大型多模态模型容易受到跨越四个不同失效类别的基于输入的破坏,这种威胁无论模型特征或测试防御如何均会持续存在,且并不需要对抗性攻击者即可破坏输出完整性。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代医院中,一种新型助手已经到来。这些是大型语言和视觉模型,即通过大量文本和图像训练而成的计算机程序,它们可以阅读病历、解读 X 光片并提供诊断建议。它们的工作原理是接收信息的流——医生输入的文字、患者说的话或一张图片所展示的内容——并将这一切处理为一个单一且连续的流。系统本身并不本质地知道该流中的哪些部分是受信任的指令,哪些部分只是背景噪音或无意的涂鸦。对于计算机而言,医生写下的命令和患者随手写的笔记看起来是同一种类型的数据。这创造了一个独特的漏洞:如果输入到机器中的信息发生哪怕极其微小的改变,无论机器本身多么聪明,其输出都可能发生剧烈的变化。
这并不是计算机损坏或制造不良的问题,而是它“倾听”方式的问题。想象一位技艺精湛的翻译员,因为过于渴望遵循指令,以至于如果有人在他们工作时在他们耳边低声下达一条新命令,他们会立即停止手头的工作并转而执行那个耳语。在人工智能领域,这被称为“提示词注入”(prompt injection),即输入内容本身劫持了系统的行为。虽然安全专家长期以来一直担心恶意黑客利用这种技巧,但一项新的系统性综述提出了一个对医学领域更令人不安的问题:这种危险是否真的需要黑客的存在?一个简单的、偶然出现在医学图像上的标记,或者患者紧急但混乱的措辞,是否也会触发同样的失败?
来自贝斯以色列女执事医疗中心(Beth Israel Deaconess Medical Center)和德布勒森大学(University of Debrecen)的研究人员组成了一个团队,旨在通过收集所有现有的、测试了这些医学模型在输入被篡改时如何反应的研究来回答这一问题。他们审查了发表于 2025 年至 2026 年间的十项特定研究,涵盖了从癌症诊断、皮肤病变分析到患者建议及用药指导的所有领域。他们的目标是观察这些强大的工具是否仅仅通过改变它们所读到的或看到的的内容,就能在无需黑客攻击计算机内部代码或访问其秘密训练数据的情况下被破坏。
研究人员发现,这些模型确实非常脆弱,而且这种破坏并不需要反派的存在。事实上,研究表明,无论输入是研究人员精心设计的蓄意攻击,还是构建成普通临床材料的非恶意内容,都会导致大规模的输出变化。然而,该综述明确指出,没有研究在匹配条件下将自然发生的现象与蓄意攻击进行对比,因此目前尚无法证实现实世界中的意外情况是否会导致同样的失败。团队将这些失败归纳为四个主要类别。第一类是指令层级失效(instruction-hierarchy failure),即隐藏的命令覆盖了医生的原始请求。第二类是证据完整性失效(evidence-integrity failure),即模型接受虚假信息或捏造的发现作为事实。第三类专门针对具备视觉能力的模型,即多模态干扰(multimodal interference),即写在或包含在医学图像中的文本覆盖了图像本身的视觉证据。第四类是交互敏感性(interactional sensitivity),即消息的语气或错误的预设会改变模型的决策。
结果是触目惊心的。在一项涉及皮肤癌图像的研究中,仅在图片上添加一个伪造的标签,就导致模型的诊断准确率从 58% 至 62% 的范围骤降至 0.0% 至 1.9%。在另一项研究中,当研究人员改变患者信息的语气使其显得更加紧急或权威时,模型建议将患者送往急诊室的比例从约 14% 跳升至高达 82%。或许最令人担忧的是,这些失败发生在不同类型的模型中,包括旧版本到最新的最强大系统。没有任何一个模型能被证明是持续安全的;一个在应对某类错误时表现稳健的系统,往往在面对另一类错误时最为脆弱。
研究人员还测试了任何现有的防御措施是否能阻止这些问题。他们研究了诸如在提示词中加入安全指令、使用第二个模型来审查第一个模型的工作成果,或在修正后的示例上对模型进行重新训练等策略。这些方法都没有消除风险。有些方法略微减少了错误,但有些则完全没有效果。有一种涉及重新训练模型的防御措施确实提高了模型拒绝虚假信息的能力,但也导致模型开始拒绝合法的请求,这本质上是用一种错误交换了另一种错误。至关重要的是,没有任何一种测试过的防御措施能应对所有类型的错误;针对一个问题的修复并不能保护系统免受另一类问题的侵害。
该综述的很大一部分篇幅集中在这些失败是否需要恶意攻击者。根据现有证据,答案是:旨在模仿普通、偶然的临床材料(如幻灯片上的手写笔记或患者自身的紧急措辞)的研究者构建的内容,足以破坏系统。然而,论文澄清说,这些内容并非取自常规护理场景,且没有研究对孤立存在的自然发生内容进行过测试。这表明,威胁不仅在于网络攻击,更在于这些模型处理信息的一种根本性缺陷。进入系统的数据的完整性,与模型本身的安全性同样重要。
作者总结道,目前医学人工智能的研究方法过度侧重于训练模型和监控其输出,可能忽略了拼图中的关键一环。如果输入到系统中的信息可以被简单的、非恶意的手段破坏,那么整个临床决策的安全性就取决于输入内容的纯净度。在我们能够保证到达这些模型的数据不受意外或蓄意操纵,并且在我们拥有能应对所有类型错误的防御措施之前,这些工具在现实医疗护理中的可靠性仍是不确定的。这些发现是一个早期预警:这些系统的安全性不仅取决于机器的智能,更取决于它被要求去阅读的那个世界的可信度。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。