Which Source Wins? Task-Dependent Reliance in Vision-Language Models
本文揭示了视觉语言模型会根据任务类型和证据结构,在文本和图像之间的依赖关系上进行动态转移,表现为在算术问题中更倾向于文本而非退化的图像,但在基于图表的推理任务中则更倾向于图像而非退化的文本。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
人类非常擅长理解这个混乱的世界。当我们从视觉和听觉等不同感官接收信息时,我们的大脑会自动权衡它们。如果其中一个来源变得嘈杂或难以理解,我们会本能地将注意力转向更清晰的一个。这种重新校准信任的能力是我们导航现实的基本方式。被称为视觉语言模型的现代人工智能系统旨在实现类似的功能。这些程序同时处理图像和文本,试图通过结合所见所读来解决问题或回答问题。长期以来,研究人员一直认为这些系统只是具有一种固定的偏好,例如可能比图片更信任文本,反之亦然。但目前尚不清楚这些模型在两个来源发生冲突且其中一个变得难以读取时,是否能够动态地调整其信任度。
一组研究人员致力于测试这种灵活性。他们想知道,当文本变得模糊或图像变得混乱时,模型是否会改变主意,以及无论哪种来源受损,其反应是否一致。为了找到答案,他们创建了一系列受控的谜题。他们将数学题渲染成图像,然后将每个图像与另一个完全不同的数学题的文本配对。这迫使模型在两个冲突的答案之间做出选择:一个是源自图片的,另一个是源自文字的。他们又用图表和书面报告重复了这个过程,创建了一个新的数据集,其中图表显示了一个答案,而随附的文本则暗示了另一个答案。在每种情况下,他们都系统地降低了一个来源的质量,通过添加模糊、噪声或缺失字母使其难以阅读,同时保持另一个来源完美清晰。然后,他们观察随着混乱程度的增加,模型会跟随哪一个来源。
结果揭示了一个令人惊讶的转折。当研究人员在数学题上测试模型时(这里的冲突本质上是两个文本版本之间的冲突——一个是屏幕上打印的,一个是写出来的),模型的表现呈现出一种特定的方式。随着文本变得难以阅读,模型对文本依赖度的转移比图像退化时更为强烈。然而,当他们在图表和报告上测试相同的模型时,行为完全反转了。在这种情景下,随着图表变得难以阅读,模型从视觉来源转移依赖度的程度比从文本来源转移的程度更为剧烈。这种反转在六个不同的开源模型中是一致的,也在两个最先进的商业模型中被观察到。研究人员发现,这些模型并没有对视觉或阅读产生永久性的偏好。相反,它们对特定来源的依赖完全取决于任务类型和证据的结构。
这一发现挑战了这些人工智能系统具有单一、不变的信息处理方式的观点。研究表明,这些模型对问题的背景非常敏感。当视觉信息是简单的文本渲染时,模型更依赖于文本来源,只有在文本变得显著难以阅读时才会转移。但当视觉信息是一个复杂的图表时,模型从视觉来源转移的力度比从文本来源转移的力度更大。研究人员确认,即使他们将图表替换为纯数字表格,这种模式仍然成立,这证明了该效应不仅仅是因为图表的图形风格,而是关于模型如何感知视觉与文本证据之间的关系。
该研究还探讨了模型是否仅仅是在对丢失的信息量做出反应。研究人员测量了当给予退化的来源时模型的准确率下降了多少,并调整了分析以解释这种损失。即使经过这种仔细的校准,行为的反转依然存在。这表明,模型不仅仅是在对损坏的严重程度做出反应,而是在对在给定情况下哪个来源更有可能正确进行更复杂的判断。研究结果表明,这些模型如何在冲突的来源之间进行仲裁是一种依赖于设置的行为,受当前任务、证据性质以及特定模型架构的影响。
通过提供一种衡量这些系统如何转移注意力的新方法,研究人员为人工智能如何处理冲突信息提供了更清晰的图景。这项工作证明,这些模型并非在偏好上僵化不变,而是能够进行动态的重新分配。然而,这种灵活性并不是统一的;它会根据背景而变化。研究结论指出,要理解这些模型如何决定信任什么,需要观察任务的具体细节和证据,而不是假设存在一个普遍规则。对于任何希望在信息可能不完美或相互矛盾的现实场景中部署这些系统的人来说,这一洞察至关重要,因为它强调了模型的信任是一个流动的变量,而非一个固定的设置。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。