← 最新论文
💻 computer science

Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models

本文揭示了多模态大语言模型能够成功编码粗粒度的视觉证据,但在可靠控制其对视觉证据与语言先验的依赖程度方面存在困难,而这一局限性可以通过监督微调和激活转向得到缓解。

原作者: Jiaang Li, Chengzu Li, Zhaochong An, Yifei Yuan, Xi Liu, Serge Belongie, Vésteinn Snæbjarnarson

发布于 2026-07-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiaang Li, Chengzu Li, Zhaochong An, Yifei Yuan, Xi Liu, Serge Belongie, Vésteinn Snæbjarnarson

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在与一个超级聪明的机器人对话,它读过几乎每一本被写下的书,也看过数百万小时的电影。这个机器人是一个“多模态大语言模型”(MLLM)。它就像一位博学多才的图书管理员,通过其训练数据掌握了关于世界的各种知识——即它的“先验知识”。但这个机器人还有眼睛。它可以观察一张图片,并将所见之物与已知之物结合起来。科学家们一直提出的一个大问题是:当机器人看到一张与其认知相悖的图片(比如一只长着五条腿的马)时,它失败是因为它“看不见”那条多出来的腿,还是因为它虽然“看见”了那条腿,却决定忽略它?这篇论文深入探讨了这个谜团,将机器人的大脑视为一场侦探故事,以查明故障究竟发生在“感官”(视觉)阶段,还是发生在“决策”(使用所见信息)阶段。

由 Jiaang Li 及其同事领导的研究团队,试图通过一项巧妙的两部分调查来解开这个谜题。首先,他们想知道机器人是否真的“看到”了图片中奇特的部分。为了测试这一点,他们不仅仅是向机器人提问;他们尝试根据机器人的内部大脑信号来重建图片。他们发现,即使在机器人给出错误答案时,那张奇特图片(如五条腿的马)的“蓝图”在其最终的思想中依然清晰可见。这就像是机器人的眼睛工作得非常完美,但其大脑却选择了闭上眼睛。这排除了机器人仅仅是对细节“视而不见”的可能性。

接着,团队创建了一个名为“WhatIfVis”的新游戏,来测试机器人如何在信任眼睛和信任记忆之间进行切换。他们向机器人展示了违反自然规律的图片(例如红色的西瓜),并要求它以两种方式回答问题:“仅观察图片”或“忽略图片并使用你所知道的知识”。他们发现,如果没有额外的训练,机器人的表现有些反复无常。有时它会忽略图片并给出教科书式的答案(例如即便西瓜是红色的,也会说西瓜是绿色的);有时它又会过度沉溺于图片,以至于无法遵循忽略图片的指令。机器人并没有坏掉,它只是缺乏一个可靠的“开关”来决定何时观察、何时思考。

然而,好消息是研究人员找到了这个开关。通过让机器人进行一点点练习(称为监督微调),针对某一类特定的棘手图片进行训练,他们教会了机器人如何控制其注意力。更棒的是,他们发现机器人大脑内部有一个特定的“旋钮”——一个单一的数学方向——可以通过这个旋钮在无需任何语言指令的情况下,开启或关闭机器人的专注力。当他们转动这个旋钮时,机器人变得更加擅长遵循规则,无论是观察图片还是忽略图片。

研究还比较了机器人处理图片与处理文字句子时的表现。他们发现,让机器人遵循一条违反规则的文字句子,要比让它遵循一张违反规则的图片容易得多。这就像是机器人是一个比观察者更优秀的听众。这种差距随着机器人的变得更加聪明和庞大而变得更大,这表明随着这些模型的发展,它们可能会在忽略所见事物方面变得更加固执。

最后,论文指出,对于我们研究的大型明显特征(如颜色、大小以及动物有多少条腿),这些 AI 模型并不是因为看不见而失败。它们失败是因为尚未学会一种一致的方法,来决定何时信任眼睛,何时信任记忆。但既然研究人员找到了一个控制这种行为的特定“旋钮”,这意味着我们未来或许能够修复它,教导这些数字大脑在世界看起来与它们的教科书不符时,变得更加灵活且可靠。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →