← 最新论文
💬 NLP

Computational Humor with Multimodal LLMs: Methods, Datasets, Evaluation, and Challenges

本综述全面概述了多模态大语言模型中的计算幽默,通过将该领域的能力划分为从识别到生成的各个阶段,综合了当前的数据集与评估协议,并识别了诸如文化局限性和安全性问题等关键挑战。

原作者: Tuo Liang, Zhe Hu, Disheng Liu, Jing Li, Yu Yin

发布于 2026-07-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Tuo Liang, Zhe Hu, Disheng Liu, Jing Li, Yu Yin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正走在一座巨大且繁忙的图书馆里,这里的书不仅仅是纸上的文字,更是会说话、会唱歌、会讲笑话的图像。这就是**多模态大语言模型(MLLMs)**的世界。把这些 AI 系统想象成超级聪明的学生,他们读过图书馆里几乎每一本书,也看过几乎每一张图片。他们非常擅长描述自己所见:“那是一只狗,”或者“那是一个着火的房子。”他们能精准地将一张猫的照片与“猫”这个词匹配起来。

但棘手的地方在于:人类的交流不仅仅关乎事实。它关乎笑话、讽刺和梗(memes)。一个梗可能展示的是一只坐在盒子里的猫,但笑点不在于猫在盒子里,而在于这只猫看起来像是一位统治着微型王国的国王,或者那个盒子实际上是一艘宇宙飞船。要理解这个笑话,你需要理解其中的隐藏含义文化引用,以及这张图片是如何在“假装”成另一种东西的。这篇论文探讨了为什么尽管我们的这些超级聪明 AI 学生能完美描述图片,但在理解笑话方面却依然表现得很糟糕。这就像有一个机器人,它能列出蛋糕的所有成分,却完全不知道为什么这个蛋糕很有趣,或者为什么它吃起来味道很好。


巨大的笑话理解鸿沟

这篇论文是 AI 在多模态幽默方面的成绩单。作者们是一组来自大学的研究人员,他们研究了 AI 理解有趣图像、卡通和梗的能力。他们发现,虽然 AI 在处理“简单”任务(比如识别出一只狗或一辆车)方面已经做得很好,但在处理“困难”任务(即弄清楚为什么某件事很有趣)时仍然步履维艰。

研究人员将这个问题组织成了三个层级,就像爬梯子一样:

  1. 第一层:识别(“是什么”)
    这是梯子的最底层。AI 能判断一张图片是否有趣吗?它能指出图片中的狗吗?论文显示,AI 在这方面其实做得相当不错。它通常能说:“是的,那个梗很有趣,”或者“那是一个政治家。”这就像一个学生能看懂笑话集里的笑点,却不知道为什么好笑。

  2. 第二层:解释与推理(“为什么”)
    这是中间一层,也是最混乱的一层。AI 能解释这个笑话为什么奏效吗?它是否理解这个笑话是在嘲讽某个特定的政治家,或者它是否使用了 1990 年代的电视文化引用?论文发现,AI 在这里遇到了大麻烦。它给出的答案听起来很对,但实际上是错的,或者完全抓错了重点。这就像一个学生能复述一个笑话,但解释的方式却因为错过了隐藏含义而破坏了幽默感。

  3. 第三层:生成(“创造它”)
    这是梯子的顶层。AI 能创作一个有趣的梗或写出一个有趣的标题吗?论文将此视为一个新的前沿领域。要创作一个好的笑话,你必须先理解幽默的规则。研究人员发现,AI 创作的笑话往往只是……很枯燥。它们可能语法正确,但并不真正有趣,因为 AI 并没有真正“领悟”幽默的机制。

三个主要问题

作者确定了 AI 在理解笑话方面遇到困难的三个主要原因:

  • “捷径”陷阱: AI 模型很聪明,但也非常“懒”。它们经常通过寻找简单的模式来猜测答案。例如,如果一张图片里有一个政治家的脸和一朵忧伤的云,AI 可能会仅仅因为以前见过这种组合就猜它是“忧伤”或“有趣”的,而没有真正理解背后的故事。论文指出,许多目前的测试过于简单,让 AI 可以通过使用这些捷径来“作弊”,而不是进行真正的思考。
  • 文化盲点: 笑话依赖于共同的知识。如果你不知道某个特定的名人是谁,或者不知道最近发生的某个新闻事件,你就无法理解这个笑话。论文指出,AI 主要是在英语和西方互联网文化上进行训练的。这就像一个学生只知道一个国家的笑话,当别人讲另一个国家的笑话时,他会完全听不懂。它错过了那些让幽默生效的“内部梗”。
  • “故事”问题: 许多有趣的东西(如连环画)会在几个分镜中讲述一个故事。笑话之所以发生,是因为第一个分镜与最后一个分镜之间的对比。论文发现,AI 往往不擅长连接这些分镜之间的逻辑。它倾向于单独观察每一张图片,而不是看到整个故事,从而错过了让连环画变得有趣的节奏感和惊喜感。

论文的实际发现

研究人员并非仅仅靠猜测;他们在许多不同的笑话数据集上测试了多种不同的 AI 模型。他们发现:

  • AI 在识别有趣事物方面正在进步, 但在解释这些事物时仍远落后于人类。
  • 最优秀的模型(例如一些规模巨大、造价昂贵的模型)在识别任务中大约能达到 80% 的准确率,但当被要求解释笑话或为卡通选择正确的标题时,其表现会大幅下降。
  • 人类仍然是喜剧之王。 在将人类与 AI 进行对比的测试中,人类始终能更好地理解笑话,尤其是在笑话需要理解社会规范或文化引用时。

论文还警告了未来。随着 AI 变得越来越擅长制造笑话,它可能会在无意中制造出刻薄或有害的笑话,因为它无法理解“幽默”与“伤害”之间的区别。这就像是给一个机器人一个脱口秀麦克风,却没教它什么是同理心。

总结

这篇论文是一个现实的警示。它告诉我们,虽然我们的 AI 朋友在描述世界方面变得非常出色,但对于世界背后的意义,它们仍然感到非常困惑。它们能看到那只狗,但并不明白为什么那只狗戴着帽子并模仿人类的行为。为了解决这个问题,作者表示,我们不应仅仅测试 AI 是否能猜出正确答案,而应该开始测试它是否能真正理解故事、文化以及笑声背后的原因。在那之前,AI 或许能讲出一个笑话,但它可能并不知道什么时候该为自己的包袱而发笑。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →