Hidden Meanings in Plain Sight: RebusBench for Evaluating Cognitive Visual Reasoning
该论文提出了 RebusBench 基准,通过 1,164 个谜题评估大型视觉语言模型在结合视觉感知与先验知识进行抽象推理方面的能力,发现现有模型在此类需要多步认知推理的任务中表现严重不足,且模型缩放和上下文学习未能带来显著改善。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇论文介绍了一个名为 RebusBench 的新测试,用来给现在的“最强大脑”(大型视觉 - 语言模型,LVLM)做一场特殊的“智商体检”。
简单来说,现在的 AI 很擅长看图说话,但非常不擅长看图猜谜。
为了让你更容易理解,我们可以用几个生动的比喻来拆解这篇论文的核心内容:
1. 现在的 AI 像什么?
想象一下,现在的 AI 就像一个超级勤奋的图书管理员。
- 它的强项:如果你给它看一张苹果的照片,它能立刻告诉你:“这是一个红色的苹果,放在桌子上。”它看得很准,描述得很详细。
- 它的弱点:如果你给它看一个字谜(Rebus),比如把字母"E"涂成红色,旁边写两个"GO",让它猜一个成语。
- 这个谜题的答案是 "Ready to go"(因为 Red E = Ready, 两个 Go = to go)。
- 但 AI 只会老老实实地描述画面:“这里有一个红色的字母 E,还有两个单词 GO。”
- 它完全猜不到这背后的谐音梗和隐喻。
2. 什么是 RebusBench(雷布斯测试)?
作者们觉得,现有的测试题太简单了,就像只考图书管理员“认字”和“数数”。为了测试 AI 是否真的具备人类的高级思维能力(也就是论文里说的“系统 2"思维,即深思熟虑、逻辑推理),他们收集了 1,164 道“看图猜成语/俗语”的谜题,组成了这个新测试。
这些谜题就像生活中的脑筋急转弯:
- 例子 A:把单词"CAKE"(蛋糕)切掉一块。
- AI 看到:一个被切了一块的单词。
- 人类看到:Slice of cake(切蛋糕/小菜一碟)。
- 例子 B:数字序列"0, 2, 3..."旁边写着"BLAME"(责备)。
- AI 看到:缺了 1 的数字和单词。
- 人类看到:No one to blame(没人可怪,因为缺了"1/One")。
3. 测试结果:AI 的“尴尬时刻”
作者让目前世界上最先进的几个 AI 模型(比如 Qwen, InternVL, LLaVA 等)来做这些题。结果非常令人震惊:
- 分数极低:无论模型多大、多聪明,做对这些谜题的准确率连 10% 都不到。
- 越练越没用:
- 加大参数(换更强的模型):没用。就像给图书管理员换了一台更快的电脑,他依然猜不出谜底。
- 给提示(少样本学习):也没用。即使你给 AI 看几个做对的例子(比如:“看,红色的 E 加两个 GO 就是 Ready to go"),它下次遇到新谜题还是猜不对。
4. 核心结论:缺了“胶水”
这篇论文指出了一个残酷的事实:
现在的 AI 拥有**“眼睛”(能看清图片)和“嘴巴”(能说很多话),也拥有“知识库”**(知道很多成语和知识)。
但是,它缺少一种**“胶水”。
这种“胶水”就是将视觉线索和语言知识创造性地粘合在一起的能力**。
- 人类看到谜题,大脑会自动进行“联想”和“跳跃”,把“红色的 E"和“准备(Ready)”联系起来。
- AI 的大脑里,视觉和语言是两条平行的线,它不知道如何把它们纠缠(Entangle)在一起,产生新的意义。
5. 总结
这就好比给一个只会背字典的机器人出了一道需要灵光一现的脑筋急转弯。
- 现状:AI 在“看图说话”上已经是满分选手。
- 瓶颈:在“看图猜谜”这种需要抽象推理和打破常规思维的任务上,AI 还像个刚学会认字的小学生,完全摸不着头脑。
RebusBench 的存在就是为了提醒科学家:光靠堆砌算力和数据(让模型更大、更强)已经不够了,我们需要教会 AI 如何像人类一样**“拐弯抹角”地思考**,而不仅仅是直来直去地描述。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。