I Came, I Saw, I Explained: Benchmarking Multimodal LLMs on Figurative Meaning in Memes
该研究通过评估八个最先进的多模态大语言模型在识别和解释网络迷因中六种 figurative 含义的能力,发现这些模型普遍存在将迷因过度关联为具有 figurative 含义的偏见,且其正确预测往往缺乏忠实于原始内容的解释。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
我来了,我看见了,我解释了:AI 能看懂“梗图”里的幽默吗?
想象一下,你正在给一群来自未来的机器人(也就是现在的多模态大语言模型)看一张网络迷因图(Meme)。
这张图可能是一只生气的猫,配文写着:“我来了,我看见了,我抱怨了"。
人类一眼就能看出:这是在玩梗,是在开玩笑,是在用反讽(Irony)来表达无奈。
但是,这些聪明的 AI 真的能看懂吗?它们能像人类一样,不仅猜出“这是个笑话”,还能解释“为什么这是个笑话”吗?
这篇论文就是做了一次**“图灵测试”级别的摸底考试**,专门测试 AI 能不能理解网络迷因里的“言外之意”。
1. 考试背景:为什么这很难?
网络迷因就像是一种**“视觉双关语”。它通常由图片和文字**拼凑而成,真正的含义往往藏在两者之间的“化学反应”里。
- 字面意思:猫在抱怨。
- 实际意思:我在模仿凯撒大帝(“我来了,我看见了,我征服了”),但把“征服”换成了“抱怨”,配合生气的猫脸,表达一种“我很无奈但只能吐槽”的幽默感。
如果 AI 只看到了猫,或者只看到了字,它可能就会误以为这真的只是一只生气的猫在抱怨,完全错过了那个“梗”。
2. 考试设置:我们怎么考?
研究者找了8 个目前最顶尖的 AI 模型(比如 Qwen, Gemma, Aya 等),让它们做三件事:
- 看图说话:这张图有没有“言外之意”?(是讽刺、夸张、隐喻,还是真的只是字面意思?)
- 给出理由:为什么你觉得它是讽刺?请解释。
- 拆解测试:
- 只给图,不给字,它能懂吗?
- 只给字,不给图,它能懂吗?
- 图文全给,它又表现如何?
3. 考试结果:AI 的表现怎么样?
结果有点让人哭笑不得,就像让一个刚学会走路的孩子去讲相声:
🚩 发现一:AI 是个“过度解读”的侦探
这是最有趣的发现。AI 有一个严重的“偏见”:它总觉得迷因图里一定有深意。
- 人类:看到一张普通的图,会说“这没啥特别的”。
- AI:看到一张普通的图,会强行说:“这一定是讽刺!这一定是隐喻!你看这个猫的眼神,充满了深意!”
- 比喻:就像你走进一家餐厅,服务员(AI)不管你是不是在开玩笑,都非要说你点的白开水是“对海洋的隐喻”。它太想展示自己懂幽默了,结果把“直白”当成了“幽默”。
🚩 发现二:不同的“梗”,需要不同的“感官”
AI 对不同类型的幽默,依赖的“感官”不一样:
- 讽刺(Sarcasm)和反语:AI 非常依赖图片。如果遮住图片,它就傻眼了。因为讽刺往往藏在表情和场景里。
- 隐喻(Metaphor):这是最难的。AI 必须同时看懂图和字,把两者结合起来才能懂。就像你要理解“时间就是金钱”这句话,既得懂“时间”的概念,也得懂“金钱”的概念,还得知道它们怎么联系。
- 夸张(Exaggeration):有时候光看文字就能懂,图片反而不是必须的。
🚩 发现三:答对了,但解释错了(“幻觉”现象)
这是最让人头疼的地方。
- 场景:AI 猜对了“这是个讽刺”,但它给出的解释却是胡编乱造的。
- 比喻:就像考试时,学生蒙对了答案“选 C",但写出的解题过程是:“因为 C 是红色的,而题目里的苹果也是红的,所以选 C"。
- 现实:AI 经常**“看图说话”说错了**。比如它把图片里的一根手指解读成“让人闭嘴的手势”,其实那只是猫在打哈欠。它为了强行解释自己的答案,开始编造图片里根本不存在的细节。
4. 人类评委的打分
研究者请了真人来给 AI 的解释打分,结果发现:
- AI 很擅长总结文字:它能准确复述图里的字。
- AI 很笨拙地看图:它经常看不懂图里的关键细节(比如猫的表情、动作)。
- AI 缺乏“人情世故”:很多迷因讽刺的是人类的心理(比如“愿意花 1000 块买手机,却不愿意花 1 块钱买 APP")。AI 因为缺乏真实的生活经验,完全无法理解这种**“人类特有的纠结心理”**,导致解释得很生硬。
5. 总结:AI 离“懂梗”还有多远?
这篇论文告诉我们:
现在的 AI 就像是一个**“博闻强记但缺乏生活阅历的学霸”**。
- 它读过很多书,知道什么是“讽刺”的定义。
- 它也能把文字和图片拼在一起。
- 但是,它不懂“梗”背后的社会心理,不懂人类那种“心照不宣”的幽默感。它太想表现得“懂行”了,反而经常过度解读,甚至瞎编乱造。
未来的方向:
我们需要教 AI 的,不仅仅是识别图片里的猫,而是要让它理解**“为什么人类会在这个时候发这张图”**。只有当 AI 真正理解了人类的社会心理和微妙的情感,它才能算是一个真正的“懂梗”的伙伴,而不是一个只会强行解释的“杠精”。
一句话总结:
现在的 AI 能认出迷因图,但经常**“戏太多”**,把普通的话当成深意,把简单的图编成故事。它离真正像人类一样“会心一笑”,还有一段路要走。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。