← 最新论文
💻 computer science

Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs

该论文提出了 REST 和 REST+ 基准测试,揭示了当前最先进的多模态大语言模型在图像、文本及混合模态间存在显著的语义推理不一致性,并发现这种不一致性受视觉特征(如颜色、分辨率)和视觉令牌数量的影响,且与模态间隙密切相关。

原作者: Angela van Sprang, Laurens Samson, Ana Lucic, Erman Acar, Sennay Ghebreab, Yuki M. Asano

发布于 2026-04-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Angela van Sprang, Laurens Samson, Ana Lucic, Erman Acar, Sennay Ghebreab, Yuki M. Asano

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是在给现在的“超级 AI 大脑”(多模态大模型)做了一次**“左右互搏”的体检**。

想象一下,你面前有一个博学的管家(AI 模型)。如果你用文字问他"3 加 3 等于几”,他立刻回答"6"。但如果你把"3+3=?"写在一张图片上拿给他看,他可能会犹豫一下,甚至回答"7"或者"5"。

这就很奇怪了,对吧?明明内容一模一样,只是“看”的方式不同,为什么答案会变?这篇论文就是专门研究这个现象的。

1. 核心发现:同一个问题,不同的答案

研究人员发现,目前的顶尖 AI 模型存在严重的**“跨模态不一致”**。

  • 比喻:这就好比一个人,用中文读故事时能理解得头头是道,但如果你把同样的故事印成图片让他“看”,他可能就读不懂了,或者理解偏了。
  • 现状:他们测试了 15 个最厉害的 AI 模型,发现没有一个能做到“无论以什么形式呈现,答案都完全一致”。哪怕是那些最聪明的模型,也有大约 10% 到 90% 的情况会“翻车”。

2. 他们是怎么测试的?(REST 测试)

为了找出真相,他们设计了一套像“压力测试”一样的游戏,叫 REST(Render-Equivalence Stress Tests,渲染等价压力测试)。

  • 玩法:他们把同一个数学题或逻辑题,做成三种形式:
    1. 纯文字(直接打字)。
    2. 纯图片(把文字打印在纸上拍成照片)。
    3. 混合模式(题目是文字,背景或选项是图片)。
  • 关键控制:他们特意把图片做得非常清晰(就像高清打印店出来的),确保 AI 能看清字(排除“看不清”这个借口)。
  • 结果:即使 AI 能完美看清图片上的字,它在“看图做题”时,依然经常比“看字做题”表现得更差,或者给出不同的答案。

3. 为什么会出现这种情况?

论文揭示了几个有趣的“幕后黑手”:

  • 文字是“亲儿子”,图片是“干儿子”:
    绝大多数模型都偏爱文字。就像一个人习惯用母语思考,突然让他用另一种语言(哪怕是同义词)思考,反应就会变慢或出错。数据显示,AI 在文字模式下的准确率通常比图片模式高出一大截。
  • 图片的“画质”很重要:
    如果把图片的分辨率调低(比如把高清图变成模糊的像素图),AI 的“视力”就会变差,答案的一致性也会大幅下降。这就像人戴了模糊的眼镜,看什么都容易出错。
  • 颜色居然能加分:
    这有点反直觉!研究发现,如果图片里的文字是红色或黄色的,AI 反而比看黑色文字时表现更好。就像在黑板上用荧光笔写字,更容易引起注意,AI 也更容易“抓住重点”。
  • 根本原因:大脑里的“两个房间”:
    研究人员深入分析了 AI 的“大脑”(内部数据)。他们发现,AI 在处理“文字”和“图片”时,大脑里激活的区域(向量空间)是分开的。
    • 比喻:想象 AI 的大脑里有两个房间,一个放“文字档案”,一个放“图片档案”。虽然它们都在同一个大房子里,但这两个房间的门没完全打通。当问题从文字变成图片时,AI 需要把信息从一个房间搬运到另一个房间,这个搬运过程容易丢东西或搞错,导致答案不一致。

4. 这对我们意味着什么?

  • AI 还没完全“通灵”:现在的 AI 虽然很聪明,但它们并没有真正像人类一样,把“看”和“读”完全融合成一种统一的感知能力。它们更像是一个“多面手”,但在不同模式下切换时,会露出马脚。
  • 不仅仅是 OCR(文字识别)的问题:以前大家以为 AI 看图出错是因为“看不清字”(OCR 识别错误)。但这篇论文证明,即使字看得清清楚楚,推理逻辑也会出错。
  • 未来的方向:要造出真正完美的 AI,不能只让它“认字”,还得让它学会把“文字”和“图像”在脑海里真正融合在一起,消除那个“两个房间”的隔阂。

总结

这篇论文就像给 AI 照了一面**“照妖镜”**:它告诉我们,现在的 AI 虽然能看图、能读字,但在“图文转换”的内心世界里,它们还在打架。只要输入的形式一变,它们的逻辑就可能崩塌。要解决这个问题,未来的 AI 需要学会“一心二用”,让文字和图像在它的脑海里真正合二为一。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →