← 最新论文
💬 NLP

"I See What You Did There": Can Large Vision-Language Models Understand Multimodal Puns?

该论文针对现有视觉语言模型在理解多模双关语方面的不足,构建了包含对抗样本的 MultiPun 数据集并提出生成流程,通过提示和模型层面的优化策略显著提升了模型区分真实双关语与干扰项的能力。

原作者: Naen Xu, Jiayi Sheng, Changjiang Li, Chunyi Zhou, Yuyuan Li, Tianyu Du, Jun Wang, Zhihui Fu, Jinbao Li, Shouling Ji

发布于 2026-04-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Naen Xu, Jiayi Sheng, Changjiang Li, Chunyi Zhou, Yuyuan Li, Tianyu Du, Jun Wang, Zhihui Fu, Jinbao Li, Shouling Ji

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是在给现在的"AI 大模型”做一场**“双关语幽默感”的体检**。

想象一下,你给一个很聪明的机器人看一张图,图上画着两个梨(Pear)手牵手,配文说:“我们真是一对(We make a great pear)。”
人类一看就乐了:因为"pear"(梨)和"pair"(一对)发音一样,而且图里两个梨手牵手,正好对应“一对情侣”的意思。这就是
多模态双关语
(Multimodal Pun)。

但现在的 AI 能听懂这个笑话吗?这篇论文告诉我们:大部分 AI 其实是个“冷场王”,甚至是个“过度解读的杠精”。

下面我用几个生动的比喻来拆解这篇论文的核心内容:

1. 现状:AI 是个“过度热情的捧哏”

研究人员发现,现在的视觉语言模型(VLM)在面对这种图文双关语时,表现得很尴尬:

  • 分不清真假:它们太想表现自己“懂幽默”了。哪怕图里画的是两个苹果,配文是“我们真是一个苹果(We make a great apple)”,明明没有双关语,AI 也会强行说:“是的!这是个笑话!因为苹果听起来像……"(其实根本不像)。
  • 只会背模板:它们不是真的理解了“梨”和“一对”的谐音梗,而是看到“两个水果手牵手”的图,就机械地联想到“情侣”、“一对”这些词,然后强行解释。
  • 结论:目前的 AI 在双关语测试中,识别率很低,而且很容易产生幻觉(把不是笑话的说成笑话)。

2. 新工具:MULTIPUN 数据集(给 AI 的“幽默考卷”)

为了彻底搞清楚 AI 到底懂不懂幽默,作者们造了一个叫 MULTIPUN 的“考卷”。

  • 考卷内容:包含 445 个真正的双关语笑话(正样本)和 890 个专门用来“坑”AI 的假笑话(负样本/干扰项)。
    • 比喻:就像老师出题,不仅要有“这道题选 A",还要有“这道题看起来像选 A,但其实选 B"的陷阱题,专门测试学生是不是真的懂了,还是靠猜。
  • 考法
    1. 判断题:这是笑话吗?
    2. 找茬题:如果是笑话,哪个词是“梗”?
    3. 解释题:为什么这是个笑话?

3. 测试结果:AI 的“幽默感”有多差?

在考卷上,AI 们表现得很“拉胯”:

  • 闭源模型(如 GPT-4o, Claude):稍微好点,但依然经常把假笑话当真笑话,或者解释得牛头不对马嘴。
  • 开源模型:表现更惨,经常把“苹果”硬说成“一对”,或者把“灯”说成“风扇”(因为成语里常说“大风扇”,它自动脑补了)。
  • 核心问题:AI 缺乏跨模态推理能力。它看不懂“图”和“字”之间那种微妙的、需要拐弯抹角的联系。

4. 解决方案:给 AI 装上“幽默眼镜”

既然 AI 不懂,作者们开了两剂药方:

药方一:Pun-CoT(提示词层面的“慢思考”)

  • 比喻:以前 AI 是“秒回”,看到图就瞎猜。现在作者给 AI 写了一套**“三步走”的说明书**:
    1. 先看图:别管文字,先老老实实描述图里到底画了什么(比如:是梨,不是苹果)。
    2. 再看字:把文字里的词一个个抠出来,别自己脑补。
    3. 最后连线:只有当“图”和“字”真的能逻辑自洽(比如梨真的和“一对”发音像),才承认是笑话。
  • 效果:就像给急躁的学生戴上了“冷静眼镜”,强迫它先思考再回答,准确率提升了 16.5%

药方二:Pun-Tuning(模型层面的“特训”)

  • 比喻:光靠“说明书”不够,还得让 AI 去**“刷题”**。作者用刚才造的那套考卷(包括真笑话和假笑话),专门训练了几个开源模型。
  • 效果:经过特训的模型,不仅更擅长识别真笑话,而且不再乱认假笑话了,变得“耳聪目明”。

5. 总结与意义

这篇论文告诉我们:

  • 幽默是人类的高级智慧:理解双关语需要同时处理视觉、听觉、语义和逻辑,这对目前的 AI 来说太难了。
  • 现在的 AI 太“顺从”:它们倾向于顺着用户的话说(用户问“这是笑话吗”,它们倾向于说“是”),而不是基于事实判断。
  • 未来方向:要想让 AI 真正像人一样幽默、机智,不能只靠堆数据,必须让它们学会**“跨模态推理”**——即真正理解图、文、音之间那种微妙的化学反应。

一句话总结
这篇论文给 AI 做了一次“幽默感体检”,发现它们大多是个“不懂装懂”的捧哏;作者们通过造了一套“陷阱考卷”和两剂“特效药”,成功让 AI 学会了**“三思而后笑”**,不再乱认笑话了。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →