Ask Twice, Look Twice: Training-Free Consistency Filtering for Reliable Medical VQA
本文介绍了“问两次,看两次”(Ask Twice, Look Twice),这是一个无需训练、与模型无关的一致性过滤框架,它利用语义等价的问题增强和视觉扰动,在无需额外模型训练的情况下,显著提升了临床环境下医学视觉问答系统(Medical Visual Question Answering systems)的可靠性与可信度。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代医学的高风险领域,医生越来越依赖人工智能来协助解读复杂的医学影像,从 X 光片到 MRI 扫描。一种特定的 AI 类型被称为视觉问答系统,旨在观察一张图片并回答关于它的自然语言问题,例如“这里显示的是哪个器官?”或“是否存在骨折?”虽然这些系统在支持临床决策方面具有巨大的潜力,但它们面临着一个关键障碍:可靠性。正如人类在问题措辞略有不同时可能会犹豫或给出不同的答案一样,这些计算机程序有时会在问题的措辞发生变化时出错,即使意思完全相同。如果 AI 因为医生以一种新的方式提问而给出了一个自信但错误的答案,那么在医院环境中的后果可能是严重的。因此,核心挑战不仅在于让这些模型变得更聪明,还在于让它们变得一致——确保无论问题如何提问或图像如何轻微改变,它们都能给出相同的正确答案。
来自悉尼大学和麦考瑞大学的研究团队开发出一种新方法来解决这个问题,而无需从头开始重新训练人工智能模型。他们将这种方法称为“问两次,看两次”(Ask Twice, Look Twice)。该方法并非试图强迫 AI 学习新知识,而是构建了一个安全过滤器,在允许模型给出答案之前检查其置信度。该系统的工作原理是获取单张医学图像和一个问题,然后自动生成几个意思完全相同的不同版本的该问题。例如,如果原始问题是“左肺的左侧显示了什么疾病?”,系统可能会创建变体,如“左肺中观察到了什么?”或“左侧存在什么发现?”。然后,它会将所有这些不同版本的提问交给 AI。如果 AI 对每一个变体都给出相同的答案,系统就会认为该结果是可靠的。如果 AI 的答案出现摇摆或相互矛盾,系统则会拒绝输出,将其标记为不确定,而不是冒着给出错误诊断的风险。
为了测试这个想法,研究人员首先必须创建一种能够自动生成这些问题变体的方法。他们使用了一种大型语言模型(一种在海量文本上训练过的先进 AI)来重写现有医学数据集中的问题。他们为这个过程制定了严格的规则:新问题必须保持与原问题完全相同的含义,并且不能引入任何原本不在图像或原问题中的新事实。这确保了 AI 测试的是其理解核心概念的能力,而不是其猜测新信息的能力。他们还检查了生成的提的问题的质量,以确保其语法正确且确实等同于原问题。这一过程使他们能够建立一个更丰富的测试场,在这里,每一张医学图像都配对了几十种不同的提问方式,而不仅仅是一种。
随后,研究人员使用名为 SLAKE 的数据集(包含数千张医学图像和问题)对两种不同的医学 AI 模型进行了测试。他们创建了四个不同版本的该数据集,以模拟现实世界的挑战。其中一个版本仅使用这些新的、多样化的问题,以测试模型如何处理语言变化。另一个版本使用了通过标准计算机技术(如改变亮度或添加一点模糊)对图像进行轻微修改后的图像,以测试视觉鲁棒性。他们还将这些变化结合在一起,甚至包含了用于欺骗 AI 的微妙修改图像,即对抗性攻击。当他们在没有这种新安全过滤器的情况下在这些数据集上运行模型时,结果是发人深省的。这些模型在语言方面表现得异常脆弱;即使是问题措辞的微小变化也会导致它们的准确率显著下降。相比之下,模型对图像的变化具有一定的韧性,尽管当文本和图像同时被改变时,它们仍然会遇到困难。
当研究人员应用他们的一致性过滤器时,“问两次,看两次”方法的真正威力显现了出来。他们设定了一条规则:只有当 AI 在一定数量的问题变体中达成一致时,才被允许给出答案。例如,如果他们要求模型在至少 11 个不同版本的提问中给出相同的答案,那么该系统就会变得更加值得信赖。在语言多样化数据集上,当应用这一严格规则时,一个顶尖模型的可靠性从大约 77% 跃升至 89%。在视觉变化数据集上,可靠性从约 80% 上升至 87%。这种提升伴随着一个权衡:由于系统现在会拒绝它不确定的答案,实际回答问题的数量减少了。在语言变化的序列中,接受率下降了约 29%,这意味着系统选择了保持沉默而非盲目猜测。然而,它提供的答案更有可能是正确的,且其预测的不确定性降低了约四分之一。
该研究还强调了这些医学 AI 模型处理不同类型错误时的关键差异。研究人员发现,模型对语言变化的敏感程度远高于对图像变化的敏感程度。即使图像变得稍微模糊或调整了对比度,模型的表现依然相对良好。但当问题被重新表述时,模型往往无法识别出问题是同一个。这表明目前的医学 AI 系统过度依赖于问题中使用的特定词汇,而不是真正理解图像中的视觉信息。研究人员指出,传统的图像变化比旨在欺骗 AI 的微妙计算机生成攻击对性能的损害更大,这一发现挑战了关于这些系统脆弱性的某些假设。
通过使用这种一致性过滤器,研究人员证明了在不需要使用新数据训练模型或改变其底层架构的情况下,大幅提升医学 AI 可靠性的可能性。该方法充当了一个守门员的角色,确保系统只在有信心时才开口。虽然这意味着系统有时会选择不回答问题,但研究人员认为,在临床环境中,一个保持沉默的系统比一个自信地给出错误答案的系统要安全得多。这种方法适用于不同类型的模型和不同类型的数据,表明它可以作为提高现实世界医院中安全性的一种实用工具。研究结论指出,虽然这些系统仍需改进,特别是在处理不同提问方式方面,但这种简单的“问两次”策略提供了一种强大的方法来过滤掉不确定性,并确保提供给医生的答案是可靠的。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。