Do Vision-Language Models Understand Visual Persuasiveness? A Diagnosis via Visual Persuasive Factors
本文诊断了视觉语言模型在评估视觉说服力方面的局限性,揭示了它们由于倾向于召回导向的偏差以及未能将物体识别与语义上下文进行适当对齐,而表现出过度预测说服力的倾向,同时证明了通过针对性的视觉说服因素(VPFs)干预可以提升性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代世界中,图像很少仅仅是装饰。从香烟包装上的公共卫生警告到政治竞选海报,视觉元素被设计用来塑造我们的思维、感受和行为方式。这种被称为“视觉说服”的过程,依赖于我们所看到的视觉信息与我们所阅读的信息之间复杂的相互作用。一张明亮、愉悦的照片可能会让安全提示显得具有鼓励性,而一张阴暗、杂乱的照片则可能让同样的提示显得具有威胁性。几十年来,心理学家一直在研究人类如何处理这些线索,理解我们的大脑如何权衡颜色、物体的摆放以及人物的存在,从而决定一条信息是否具有说服力。现在,随着人工智能系统已经能够同时观察并阅读图像,一个关键的问题出现了:这些机器是否像人类一样理解说服力,还是仅仅基于表层模式进行猜测?
韩国 POSTECH 的一个研究小组试图通过对现代视觉语言模型进行严格测试来回答这个问题。这些是先进的计算机系统,它们可以观察图像并阅读文本信息,然后尝试理解图像在多大程度上支持了文本。研究人员从一个精心策划的 562 个“图像-信息对”集合开始。这些并非随机从互联网上搜寻的内容;它们之所以被选中,是因为人类评审员已经看过它们,并且在判断每个组合是“高度具说服力”还是“不具说服力”方面几乎达成了一致。这创造了一个清晰的“地面真值”(ground truth),可以用来衡量计算机模型。目标是看机器能否复制人类的判断,或者它们是否遗漏了关于视觉说服运作方式的某些根本性内容。
结果揭示了这些人工智能系统运作方式中一个显著且一致的缺陷。当被要求判断说服力时,模型表现出一种倾向于说“是”的强烈偏见。它们非常擅长捕捉人类认为具有说服力的图像,但也过于急于将非说服性的图像标记为具有说服力。用技术术语来说,它们实现了高“召回率”,但却遭受了大量的误报(假阳性)。本质上,机器在过度预测说服力,将几乎任何包含合理视觉元素的图像都视为成功的论证。它们似乎缺乏人类那种辨别视觉线索仅仅是“存在”还是真正起到“说服作用”的能力。
为了理解为什么会发生这种情况,研究人员将视觉世界分解为特定的、可衡量的组成部分,称之为“视觉说服因子”。这些因子涵盖了从图像的即时感官冲击(如色彩丰富度和亮度)到构图(如主体是位于中心还是位于虚拟网格线的交汇处)的各个方面。他们还观察了语义元素,例如关键物体、人物或文本是否可见。当研究人员比较人类和机器如何权衡这些因子时,出现了一种明显的差异。人类使用这些线索时具有细微的差别,理解明亮的图像可能对正面信息具有说服力,但对负面信息则不然。然而,机器通常将仅仅是因子的“存在”视为成功的保证。例如,如果图像中包含一个人的脸或文本中提到的特定物体,模型很可能会宣布其具有说服力,即使整体语境表明并非如此。它们误将食谱的原料当成了成品菜肴。
研究随后探讨了给予机器更明确的指令是否能解决这个问题。研究人员尝试了两种主要方法。首先,他们向模型提供有关视觉因子的详细知识,例如告诉它们,人物的存在应该被视为一个辅助线索,而不是决定性因素。其次,他们要求模型进行“分步思考”,在做出最终判断前先拆解其推理过程。研究结果是微妙的。提供正确的上下文——具体而言,将这些视觉线索界定为需要被“解读”而非“固定规则”的东西——确实有助于减少错误。然而,仅仅要求模型进行推理或指出物体的存在是不够的。在某些情况下,强迫模型利用显性线索进行推理反而加剧了它们的偏见,导致它们在错误的判断上变本加厉。
研究人员发现,核心问题在于机器推理过程中的一个特定瓶颈。当团队分析模型生成的逐步解释时,发现机器通常擅长识别物体并描述文本。它们也可以解释一个物体如何与信息相关联。失败发生在最后一步:将这些证据与沟通的最终目标联系起来。模型难以判断所发现的视觉证据究竟是真正支持了预期的信息,还是仅仅是一种巧合。它们能看到局部,但无法可靠地将这些局部综合成一个连贯的意图判断。
这项研究表明,尽管人工智能在识别图像内容方面取得了巨大进步,但它仍然缺乏对“为什么该图像很重要”的深度语境理解。目前的机器非常擅长识别说服力的“原料”,但对于“品尝成品”却表现拙劣。它们倾向于假设,如果具备了正确的视觉元素,信息就一定具有说服力,从而忽略了人类权衡语境、语气和意图的微妙能力。研究结论指出,要使这些系统真正理解视觉说服,它们需要超越单纯识别物体,学会将这些观察到的现象与背后的传播目的联系起来。在能够实现这一跨越之前,它们仍会倾向于在没有说服力的地方看到说服力,将线索的存在误认为是信息的威力。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。