← 最新论文
💻 computer science

MLLMs Get It Right, Then Get It Wrong: Tracing and Correcting Late-Layer Textual Bias

本文识别了多模态大语言模型中存在的一种“后层文本覆盖”现象,即正确的视觉预测在最终层被文本偏差所抑制,并提出了一种无需训练的方法 CALRD,该方法能够检测并恢复这些被覆盖的视觉见解,从而显著提升在冲突基准测试上的性能。

原作者: Xingming Li, Ao Cheng, Qiyao Sun, Xixiang He, Xuanyu Ji, Runke Huang, Qingyong Hu

发布于 2026-06-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Xingming Li, Ao Cheng, Qiyao Sun, Xixiang He, Xuanyu Ji, Runke Huang, Qingyong Hu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心问题: “回声筒”效应

想象你是一名正在观察犯罪现场照片的侦探。照片清晰地显示了一辆红色的汽车。然而,一名证人(文本)走进来说道:“我看到了一辆蓝色的汽车。”

当你询问标准的视觉语言大模型(MLLM)这个问题时,它往往会忽略照片,并自信地回答:“蓝色。”尽管视觉证据就在眼前,模型却更信任文本。这在现实生活中是非常危险的(例如在医学影像或自动驾驶领域),因为比起视觉事实,过度信任错误的故事会导致严重的错误。

意外发现:模型其实“看”到了

研究人员通过观察模型的内部层级(就像窥视工厂流水线的不同阶段一样),深入研究了这些模型的“思考”过程。

他们发现了一个令人惊讶的事实:模型最初其实是正确的。

  • 流水线类比: 将模型想象成一个拥有 30 个组装站(层)的工厂。
    • 第 1–20 站: 工人们观察照片,并正确地识别出汽车是红色的。他们很有信心。
    • 第 21–30 站: 突然间,工人们开始听从文本描述。他们变得困惑,改变了主意,仅仅因为文本说是蓝色,就决定将汽车包装成蓝色

视觉信息并没有丢失;它只是在处理的最后阶段被文本覆盖了。作者将这种现象称为**“后期层文本覆盖”(Late-Layer Textual Override)**。

线索:模型转向了哪边?

研究人员注意到模型改变主意的模式:

  • 当失败时: 它从视觉答案(红色)开始,转向文本答案(蓝色)。
  • 当成功时: 它可能从一个模糊的想法开始,转向视觉答案(例如,从“可能是蓝色”变为“确定是红色”)。

他们意识到,变化的方向可以告诉你模型是否正在犯错。如果模型在最后几层中从图像转向文本,那么它很可能会出错。

解决方案:CALRD(“记忆守护者”)

为了在不重新训练模型(这既昂贵又缓慢)的情况下解决这个问题,作者创建了一种名为 CALRD 的方法。

把 CALRD 想象成站在流水线末端的质量控制检查员

  1. 检查: 检查员查看工人们在流水线“中间阶段”(转换点)做出的决定。中间的工人对红色的汽车有信心吗?
  2. 对比: 检查员检查最后的工人做出了什么决定。他们是不是因为文本说是蓝色就改成了蓝色?
  3. 干预: 如果中间的工人对红色汽车很有信心,但最后的工人却因为文本说是蓝色而改变了主意,检查员就会介入。他们会说:“等等!中间的团队是对的。让我们保留‘红色’这个答案。”

这种方法是**无需训练(training-free)**的。它并不教给模型新知识,它只是帮助模型记住它在被文本搞糊涂之前就已经知道的事实。

实验结果

团队在五种不同的 AI 模型上进行了测试。

  • 修复效果: 在文本与图像不一致的测试中,模型的准确率显著提升(最高提升了 9.4%)。
  • 无副作用: 至关重要的是,当不存在冲突时,该方法不会破坏模型的表现。如果文本和图像一致,检查员就会让模型正常工作。
  • 速度: 它几乎不会增加额外的处理时间,使其在实际应用中非常实用。

总结

这篇论文指出,这些 AI 模型并非对图像“视而不见”。它们看到了真相,但在思考的最后几秒钟被文本“说服”了。新方法 CALRD 就像一个记忆辅助工具,在模型试图忽略视觉证据并试图转向错误答案时,及时捕捉它,并温柔地将其引导回正确答案。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →