← 最新论文
💻 computer science

CounterCount: A Diagnostic Framework for Counting Bias in Vision Language Models

本文介绍了 CounterCount,这是一个诊断框架,它揭示了视觉 - 语言模型在反事实计数任务中更依赖物体先验而非视觉证据,并提出了一种推理时注意力调制策略,以显著提高其准确性。

原作者: Reem Alzahrani, Hassan Alshanqiti, Bushra Bin Hemid, Zaid Alyafeai, Abdelrahman Eldesokey, Bernard Ghanem

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Reem Alzahrani, Hassan Alshanqiti, Bushra Bin Hemid, Zaid Alyafeai, Abdelrahman Eldesokey, Bernard Ghanem

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你有一只非常聪明、博览群书的鹦鹉,它 memorized 了数百万本关于世界的书籍。你给这只鹦鹉看一张兔子的图片,并问:“这只兔子有几只耳朵?”由于鹦鹉读过太多关于兔子的故事,它立刻回答:“两只!”而并没有真正去看那张图片。它依赖的是它的记忆(它认为兔子应该长什么样),而不是它的眼睛(照片中实际有什么)。

现在,想象你拿着同一张兔子的图片,用数字编辑器给它加上四只耳朵。如果你再次问这只鹦鹉,一只真正善于观察的动物会说:“四只!”但这只聪明的鹦鹉仍被困在它的记忆中,固执地回答:“两只!”它无视视觉证据,因为它的“书本知识”如此强大,以至于压倒了它所看到的内容。

这正是论文CounterCount所研究的问题。

问题:“书本智慧”与“眼睛”之间的冲突

研究人员发现,现代人工智能模型(称为视觉 - 语言模型)在阅读和对话方面表现出色,但在简单的计数任务中,当图片与其从训练数据中学到的内容相矛盾时,它们往往会失败。它们就像那只鹦鹉:更信任内部的“规则手册”,而不是眼前实际的图像。

解决方案:一套诊断测试工具包

为了证明这一点,研究团队构建了一个名为CounterCount的特殊测试工具包。

  • 设置:他们创建成对的图像。一张是正常图片(例如,一辆有 4 个轮子的汽车)。另一张是“反事实”图片,其中他们通过数字方式修改了特定部分(例如,同一辆汽车现在有了 6 个轮子)。
  • 测试:他们向人工智能提问:“这辆汽车有多少个轮子?”
  • 结果:人工智能在正常图片上表现很好。但在那些奇怪的、经过编辑的图片上,它经常失败,坚持给出“正常”答案(4),而不是数出实际的轮子数量(6)。这证明了人工智能为了迎合其预先学习的偏见,而忽视了视觉证据。

“原因”:人工智能在看,但没有听

你可能会认为人工智能失败是因为它无法看见额外的轮子。研究人员深入挖掘后发现并非如此。

  • 隐喻:想象人工智能是一个正在参加考试的学生。这个学生正看着图表的正确部分(轮子),但它的脑海中被一个大声喊叫的声音分散了注意力:“汽车有 4 个轮子!”学生看到了 6 个轮子,但这个“大声的声音”(语言偏见)淹没了视觉信号。
  • 证据:通过查看人工智能内部的“注意力图”(显示人工智能关注的内容),研究人员发现人工智能确实在看轮子。然而,它并没有给予这些轮子足够的“心理权重”来覆盖其记忆。

修复:调大眼睛的音量

研究人员开发了一种称为注意力调制的巧妙技巧。

  • 类比:将人工智能的大脑想象成一个带有许多推子的声音混音器。一些推子控制“视觉证据”(图片),另一些控制“语言先验”(记忆)。
  • 操作:他们创建了一种方法,手动将控制正在计数的图像特定部分(如轮子或耳朵)的推子音量调大,并将背景噪音或干扰性的“记忆”声音的音量调小
  • 结果:当他们在人工智能回答时应用这种“音量控制”后,它在计数编辑后的图片时突然变得好多了。准确率提高了高达 8%。它不需要重新训练或学习新事实;它只需要被告知:“嘿,更仔细地看你此刻实际看到的东西。”

总结

简而言之,这篇论文表明,即使是最聪明的人工智能模型,如果其内部知识过于强大,也可能对现实“视而不见”。他们构建了一个测试来证明这一点,发现这些模型确实在看正确的东西,但没有听从它们,并通过让视觉证据在人工智能的决策过程中发出更响亮的声音来解决了这个问题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →