Which Modality Decides? Counterfactual Modality Attribution for Multimodal LLMs
本文介绍了反事实模态归因(Counterfactual Modality Attribution, CMA),这是一个利用耦合扩散先验和 Shapley 值来量化哪种模态(图像或文本)驱动多模态大语言模型预测的新型框架,从而揭示了传统特征级可解释性方法所遗漏的不安全推理模式。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一名试图破解谜团的侦探,但你拥有两个截然不同的搭档:一个是摄影师,他只给你看照片;另一个是说书人,他只用语言与你交流。在人工智能的世界里,被称为多模态大语言模型(MLLM)的超级智能计算机就像这支侦探团队。它们能够同时观察图像并阅读文本,从而做出重大决策,比如诊断病人或识别问题。但棘手的部分在于,仅仅因为计算机得到了正确的答案,并不意味着它通过正确的方式得出了结论。有时,它可能会“依赖捷径”——即忽略照片只读文本,或者反之亦然。这是一个巨大的问题,因为如果我们不知道究竟是哪位搭档在出力,我们就无法在严肃场合信任这位侦探。我们需要一种方法来询问:“嘿,到底是靠那张照片解决的,还是靠那个故事?”
这正是由萨拉热窝大学和伦敦国王学院的研究人员开展的一项新研究所针对的问题。他们担心这些 AI 侦探可能会采取“捷径”——即在忽略其中一类关键线索的情况下,仅依赖另一类线索,即便最终答案看起来是正确的。为了解决这个问题,他们发明了一个聪明的工具,叫做反事实模态归因(Counterfactual Modality Attribution, CMA)。把 CMA 想象成一台“如果……会怎样?”机器。它会对 AI 提问:“如果我们只给你看照片会怎样?”以及“如果我们只给你文字会怎样?”通过创造这些虚构的“如果……会怎样”的情景,该工具可以精确测量图像和文本分别贡献了多少。他们在虚构谜题和真实医疗报告上进行了测试,发现 CMA 在识别 AI 是否忽略关键信息方面表现得极其出色。事实上,在受控测试中,它能 98% 地正确识别出决策的真正来源,揭示了其他方法所忽略的隐藏错误。
侦探的困境
想象一下,你是一名试图判断病人是否患有肺炎的医生。你有两份证据:一张胸部 X 光片(图片)和一份护士写的医疗报告(文本)。护士的报告写着:“患者对青霉素过敏。”而 X 光片清晰地显示了肺炎。一个聪明的 AI 应该观察两者,得出结论:“是的,是肺炎”,然后推荐一种不是青霉素的安全抗生素。
但如果 AI 是在“依赖捷径”呢?如果它看了 X 光片,看到了肺炎,然后立即选择了某种抗生素,却根本没有阅读护士的便条呢?如果这种抗生素恰好是青霉素,病人可能会发生生命危险。AI 得出了正确的诊断,但因为它忽略了文本,所以它未能通过安全检查。这被称为“捷径学习”(shortcut learning),它是危险的,因为 AI 在纸面上看起来很完美(它得到了正确的诊断),但在现实世界中却是不安全的。
问题在于,目前大多数检查 AI 的工具只能观察 AI 在“看”哪里。它们可以围绕 X 光片上的肺炎画一个红框,或者高亮文本中的“青霉素”这个词。但它们无法回答那个核心问题:究竟是哪一个因素促使 AI 做出了决定? 是图片驱动了决策,还是文本驱动了决策?或者是两者共同作用?
“如果……会怎样?”机器
研究人员创造了一种名为**反事实模态归因(CMA)**的新方法来解决这个问题。“反事实”(counterfactual)这个词是一个高级说法,意思就是“如果……会怎样”。CMA 与 AI 进行一场“如果……会怎样”的游戏。
以下是使用一个简单的类比来解释其工作原理:
想象你在制作一个含有两种原料的蛋糕:面粉和糖。你想知道哪种原料让蛋糕吃起来是甜的。
- 原始蛋糕: 你用面粉和糖一起烤了一个蛋糕。它尝起来很甜。
- “如果……会怎样”的情景:
- 情景 A(仅限图像/原料): 你只用面粉烤了一个蛋糕(没有糖)。
- 情景 B(仅限文本/原料): 你只用糖烤了一个蛋糕(没有面粉)。
- 情景 C(两者都移除): 你既没用面粉也没用糖烤了一个蛋糕。
通过品尝这些不同的蛋糕,你可以准确判断出糖贡献了多少甜味。如果只有糖的蛋糕依然很甜,而只有面粉的蛋糕很淡,你就知道糖才是主角。
CMA 对 AI 进行同样的操作,只不过它使用的不是蛋糕,而是图像和文本。它使用特殊的“魔法生成器”(称为扩散模型)来创建输入内容的逼真版本,在其中移除文本但保留图像,或者移除图像但保留文本。然后,它要求 AI 对这些修改后的新版本进行预测。
计分板:谁在出力?
一旦 AI 对所有这些“如果……会怎样”的版本做出了预测,CMA 就会使用一种叫做**沙普利值(Shapley values)**的数学评分系统。你可以把它想象成电子游戏中的计分板,有两个玩家(图像和文本)组成了一个团队。计分板会计算每个玩家为团队的胜利贡献了多少。
- 如果你在移除文本后 AI 改变了主意,那么“文本”会获得高分。
- 如果你在移除图像后 AI 改变了主意,那么“图像”会获得高分。
- 如果 AI 需要两者结合才能得到正确答案,则两人平分分数。
结果是一个清晰的百分比:“90% 图像,10% 文本”。这告诉我们究竟是哪种模态在驱动决策。
他们的发现
研究人员通过两种方式测试了 CMA:
- 虚构谜题: 他们创建了一个游戏,在这个游戏中,他们确切知道 AI 应该只依赖图片或只依赖文本。在这些测试中,CMA 表现得像个超级明星。它能 98% 地正确识别出那些“依赖捷径”的 AI。而其他仅仅观察单个像素或单词的方法则会产生混乱并无法识别偏差。
- 真实医疗报告: 他们在真实的胸部 X 光片和医生笔记数据集上进行了测试。他们发现了 AI 依赖奇怪捷径的情况。例如,在其中一个案例中,AI 诊断出“结节”(肿块)是因为它看到了 X 光片上的心电图导线(电线),而不是因为它看到了真正的肿块。当 CMA 移除了导线(图像捷径)时,AI 改变了主意。这证明了 CMA 能够发现其他工具会错过的危险捷径。
为什么这很重要
这篇论文传达的最重要的信息是:仅仅答对是不够的。 AI 可以出于错误的原因给出正确的答案。如果我们只检查答案是否正确,我们可能会忽略 AI 正在忽略关键安全信息(如过敏史)这一事实。
CMA 为我们提供了一种审计 AI 思维过程的方法。它不仅告诉我们 AI 决定了什么,还告诉我们它为什么做出这样的决定。这对于医疗、自动驾驶或法律决策等高风险领域至关重要,在这些领域,我们需要确保 AI 使用了所有的证据,而不仅仅是那些容易获取的信息。
研究人员承认,他们的工具需要消耗一定的计算能力,且目前尚不完美,但这是向前迈出的重要一步。它将 AI 决策的“黑箱”变成了我们可以理解并信任的东西,确保当 AI 说“我很确定”时,它确实是基于正确的原因而确定的。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。