← 最新论文
💻 computer science

Can MLLMs "Read" What is Missing?

本文提出了 MMTR-Bench 基准,旨在通过移除显式提示并直接要求模型从视觉上下文(如文档和网页)中重构被掩码的文本,来评估多模态大语言模型在布局理解、视觉定位及知识整合方面的内在能力。

原作者: Jindi Guo, Xi Fang, Chaozheng Huang

发布于 2026-04-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Jindi Guo, Xi Fang, Chaozheng Huang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 MMTR-Bench 的新测试,用来给现在的“多模态大语言模型”(MLLMs,也就是能看图说话的人工智能)做体检。

为了让你轻松理解,我们可以把这篇论文的核心内容想象成一场**“蒙眼找茬”的考试**。

1. 以前的考试 vs. 现在的考试

  • 以前的考试(传统问答):
    想象老师给你看一张复杂的地图,然后问你:“北京在哪里?”或者“图里那个红色的三角形代表什么?”。
    在这种模式下,AI 只要盯着老师问的问题,去图里找答案就行。这就像**“开卷考试”**,题目已经告诉你去哪里找线索了。

  • 现在的考试(MMTR-Bench):
    这次,老师把地图上的关键信息(比如“北京”这两个字,或者某个重要的数据)用黑布盖住了。
    老师不提问,只是把这张盖着黑布的图扔给 AI,说:“嘿,把这块黑布下面原本是什么字,给我猜出来!”
    AI 不能问“我要找什么?”,它必须自己观察周围的线索(比如周围的街道名、地形、其他文字),结合自己的常识,主动推理出被遮住的内容是什么。

这就好比: 以前是老师指着黑板问“这是什么?”,现在是老师把黑板擦掉一块,让你凭记忆和周围剩下的粉笔字,把擦掉的内容补全。

2. 这个考试有多难?(难度分级)

这个考试把题目分成了四个难度等级,就像游戏里的关卡:

  • Level 1(简单): 遮住的是一个数字或年份(比如"2024")。这就像猜一个电话号码,只要对得上就行。
  • Level 2(中等): 遮住的是一个短语(比如“人工智能”)。需要理解上下文。
  • Level 3(困难): 遮住的是完整的一句话。需要理解整段话的逻辑。
  • Level 4(地狱级): 遮住的是整整一段解释性的文字。这需要 AI 像侦探一样,把散落在图里图外的所有线索拼凑起来,甚至需要懂一些专业领域的知识(比如农业、医学、法律)。

3. 考试结果:AI 们表现如何?

论文测试了很多目前最厉害的 AI 模型(包括闭源的巨头和开源的小模型),结果发现:

  • 简单题大家都能做对: 遮住几个字,大部分 AI 都能猜对。
  • 难题就露馅了: 一旦遮住的是长句子或大段文字,AI 就开始“胡言乱语”了。
    • 有的 AI 像“抄作业”: 它不看被遮住的地方,而是把旁边没被遮住的词直接抄过来(比如旁边写着“实验”,它就猜被遮住的是“实验”)。
    • 有的 AI 像“瞎猜”: 它虽然知道大概讲什么(比如图里在讲农业),但猜不出具体的专业术语(比如把“舱口”猜成了“通风口”)。
    • 有的 AI 甚至“装傻”: 它根本没发现图里有黑布,直接开始描述整张图,完全没完成任务。

结论是: 现在的 AI 虽然很聪明,能看懂图,但**“补全缺失信息”**这种需要深度推理和全局理解的能力,还远远不够强。闭源的大模型(像 Gemini、GPT 系列)表现最好,但开源的小模型差距明显。

4. 为什么要搞这个考试?(核心意义)

作者认为,以前的考试太依赖“老师提问”了,这掩盖了 AI 真正的弱点。

  • 现实世界没有老师: 当你看一份复杂的合同、一张多页的财报,或者一个充满图表的网页时,并没有人指着某处问你问题。你需要自己发现哪里缺了信息,哪里逻辑不通。
  • 真正的智能是“补全”: 一个真正聪明的 AI,应该像人类一样,看到残缺的拼图,能根据周围的图案,自动把缺失的那一块“脑补”出来,而不是等着别人告诉它缺哪一块。

5. 未来的方向

论文最后提出,未来的 AI 训练不应该只是“看图说话”,而应该大量使用这种**“蒙眼补全”**的方式。让 AI 在训练时不断练习“猜被遮住的内容”,这样它才能真正学会理解图片里的逻辑、结构和深层含义,而不仅仅是识别上面的字。


一句话总结:
这篇论文给 AI 出了一道**“看图补字”**的难题,发现现在的 AI 虽然能看懂图,但一旦没人给提示,让它们自己把被遮住的关键信息“脑补”出来,它们就会变得很笨拙。这提醒我们,AI 离真正的“理解”还有很长的路要走。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →