MemeBench: What LVLMs Miss When Interpreting Culture-Dependent Memes
本文介绍了 MemeBench,这是一个利用 VIKR 模式进行诊断的基准测试,旨在评估并揭示大型视觉语言模型在解读模因时存在的特定文化知识差距,并证明了虽然实体引导的检索改进了知识整合,但目前是以牺牲视觉覆盖范围为代价的。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你走进一个充满人们交谈声的房间,但他们说的是一种你不懂的语言,你只能看到他们的脸、衣服以及他们手持的物品。你是一个旨在精确描述所见之物的超级智能机器人。你可以说,“那个人戴着一顶红色的帽子,”或者“他们拿着一个金色的杯子。”你对像素的描述近乎完美。然而,这时有人指着一张穿着微型燕尾服的猫的照片对你说:“这是一个关于猫认为自己拥有互联网的梗(meme)。”如果你不知道什么是互联网,不知道猫奴的文化,或者不理解这个笑话,你可能只会说:“这是一只穿着西装的猫。”你完美地描述了图片,但你完全错过了它的精髓。
这正是研究人员试图弥补的鸿沟——大型视觉语言模型(LVLM)之间的差距。这些是既能“看”图又能针对图像进行“言说”的 AI 系统。长期以来,我们认为如果一个 AI 能准确描述一张图片,它就理解了图片。但本文指出,描述并不等同于解释。这就像是读懂了一个笑话的文字,却并不理解它为什么好笑。要理解一个梗,你需要的不仅仅是眼睛;你还需要一个包含文化知识、内部笑话和社群历史的“图书馆”,而这些内容并不会直接写在图片上。如果 AI 无法访问这个隐藏的图书馆,它就像是一个能看懂地图却不了解当地俚语或地标历史的游客。
于是,由 Bilibili、复旦大学和北京大学的研究人员共同开发的全新诊断工具 MemeBench 应运而生,旨在测试这些 AI 模型究竟在哪里卡壳。你可以把 MemeBench 想象成一场针对 AI 的“文化常识小测验”,专门针对动漫、漫画、游戏和互联网亚文化(通常被称为 ACG)这个变化极快、极其活跃的世界。研究人员收集了 1,253 个中英文双语梗。但他们并没有只是问 AI,“这好笑吗?”或者“答案是什么?”,而是要求 AI 写出完整的解释。随后,他们利用一个被称为 VIKR 的系统,将这些解释拆解为四个特定的要素:
- 视觉(Visual): 你是否看到了图片中实际存在的物体?
- 身份(Identity): 你是否知道角色或物体的具体身份?(例如:那是一个普通的忍者,还是特定的鸣人?)
- 知识(Knowledge): 你是否了解让这个梗变得有趣的背景故事或文化规则?
- 推理(Reasoning): 你是否通过逻辑连接,解释了这个笑话?
研究人员测试了 26 种不同的 AI 模型,涵盖了从最大的商业模型到开源实验模型。结果发现了一个巨大的惊喜:每一个模型在描述图片方面都比理解笑话的能力要强。 即便是测试中最聪明的 AI,也能高精度地描述视觉细节,但一旦涉及到理解梗所需的文化知识时,它就会跌跤。表现最好的模型在“视觉观察能力”与“文化认知能力”之间仍存在 22.6% 的“差距”。这就像拥有一双完美的眼睛,大脑却缺少一份关于这个世界的说明书。
该论文还反驳了这样一种观点,即仅仅给 AI 增加更多的“推理步骤”(即告诉它“一步步思考”)就能解决这个问题。事实并非如此。模型依然会缺失文化语境。然而,研究人员也找到了改进方法。他们引入了一种称为 KAR(知识感知检索)的方法。想象一下,在 AI 尝试解释笑话之前,它被允许先在一个专门构建的百科全书(名为 CultureBase)中快速查阅特定的角色名称和历史,而不是直接去搜索整个互联网。这不仅让 AI 变得更聪明,也让它变得更精准。它帮助 AI 找到了缺失的文化碎片(身份与知识),同时又不会破坏其视觉描述的准确性。
简而言之,这篇论文表明,虽然 AI 正在变得擅长充当“照相机”,但它在成为“文化评论家”方面仍然面临挑战。模型的失败并非因为它们看不见,而是因为它们不知道图像背后的故事。通过使用 MemeBench,研究人员现在可以精准定位解释中缺失的具体部分——无论是角色的名字、事件的历史,还是笑话的逻辑——而不仅仅是给出一个单一的分数。这有助于开发者构建出不仅能描述世界,而且能真正理解其中文化的 AI。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。