DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models
本文提出了 DICA,一种通过监测视觉注意力熵(Visual Attention Entropy)和输出图像相关性(Output Image Correlation),在视觉定位偏离理想的由粗到精推理过程时触发针对性对比对齐,从而缓解多模态大语言模型中幻觉问题的创新方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图通过观察一张拥挤的照片来破解一个谜团。人类侦探不会对着整张照片发呆。相反,他们会先进行一次广泛的扫描以获取场景的“氛围”,然后,他们的目光会聚焦到具体的线索上——一只红色的鞋子、一扇破碎的窗户或是一个可疑的影子——从而拼凑出答案。这正是我们大脑工作的自然方式:从宏观的概览走向锐利的细节。
现在,想象一下在教一个超级聪明的机器人也这样做。我们已经构建了这些能够看图并能针对图片进行交谈(例如回答关于照片的问题)的“多模态大语言模型”(MLLMs)。但问题在于:有时这些机器人会感到一阵眩晕。它们可能会开始盯着图片的错误部分,或者完全停止观察图片,转而根据以前听到的信息进行猜测。当这种情况发生时,它们就会开始“幻觉”——编造不存在的事实,比如仅仅因为喜欢狗,就在一张猫的照片里声称有一只狗。科学家们正在努力研究如何阻止这些机器人“白日做梦”,以便让它们成为现实世界中可靠的助手。
这篇论文介绍了一个名为 DICA(双指标引导对比对齐,Dual-Indicator Guided Contrastive Alignment)的巧妙新系统,它充当了这些 AI 侦探的“抽检”监督员。研究人员注意到,当这些模型开始产生幻觉时,通常会犯两种特定的错误。首先,它们的注意力可能会“漂移”,这意味着它们的焦点突然像一只紧张的松鼠一样在图像上到处乱窜,失去了重要的线索。其次,它们可能会“低度利用”视觉证据,这意味着它们停止观察照片,转而过度依赖其内部记忆或猜测。
为了捕捉这些错误,DICA 使用了两个内部“仪表”(指标)来监控机器人在思考时的“大脑”。第一个仪表叫做视觉注意力熵(Visual Attention Entropy),用于测量机器人的注意力有多分散。如果这个数值激增,意味着机器人在恐慌,正在到处乱看。第二个仪表是输出-图像相关性(Output-Image Correlation),用于检查机器人的回答究竟在多大程度上依赖于图片,还是仅仅依赖于它自身的文本预测。如果这个数值下降,说明机器人正在忽略照片并在凭空捏造。
当 DICA 看到这些仪表进入“红区”时,它不会任由机器人继续瞎猜。相反,它会触发一种“纠正模式”。如果机器人的焦点正在漂移,DICA 会将它当前混乱的想法与同一个问题的“冷静版”进行对比,以将其引导回正确的地点。如果机器人正在忽略照片,DICA 则会强制它重新审视之前发现的视觉线索,本质上是在说:“嘿,还记得你在照片里看到了什么吗?用回那些信息!”
作者在几个标准的测试中测试了这种方法,在这些测试中,机器人需要回答关于图像的问题或描述图像。他们发现,DICA 始终能帮助模型获得更多正确答案,并减少编造事实的情况。例如,在一项名为 POPE 的测试中,该方法显著提高了模型的准确率,帮助它正确识别实际存在的物体并忽略不存在的物体。在另一项衡量机器人描述中发明物体频率的测试(CHAIR)中,DICA 减少了虚假物体的出现次数。
论文指出,这种方法之所以特别有效,是因为它不仅仅应用了一个通用的“停止猜测”规则。相反,它诊断出了机器人在那一特定时刻失败的具体原因——是分心了,还是忽略了证据?——并随后应用了精确的修复方案。虽然该方法会给思考过程增加一点额外的时间(每个词大约 0.04 到 0.08 秒),但研究人员认为,为了防止机器人自信地陈述谬误,这点代价是值得的。最终,这项研究表明,通过观察这两个简单的指标并在必要时进行干预,我们可以让这些强大的 AI 工具变得更加值得信赖,并且更立足于现实。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。