← 最新论文
💬 NLP

Memes-as-Replies: Can Models Select Humorous Manga Panel Responses?

该论文提出了名为 MaMe-Re 的基准数据集与“梗图回复选择”任务,通过 10 万对标注数据揭示当前大语言模型虽能捕捉部分社会语境线索,但在利用视觉信息增强幽默理解及区分微妙机智方面仍存在显著局限。

原作者: Ryosuke Kohita, Seiichiro Yoshioka

发布于 2026-02-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Ryosuke Kohita, Seiichiro Yoshioka

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是在教电脑如何学会“讲段子”和“接梗”。

想象一下,你在网上聊天,朋友发了一张“袜子破洞了”的照片。如果你是个幽默的人,你可能会回一张漫画,画着一个角色大喊:“你竟然要抛弃她?!”(把袜子拟人化了)。这种用图片(梗图/漫画)来回复文字的行为,就是论文研究的重点。

以前的电脑研究只关注“这张图本身好不好笑”,但这篇论文问了一个新问题:"在特定的聊天语境下,哪张图回复得最有趣?"

为了回答这个问题,作者们做了一件很酷的事:

1. 造了一个巨大的“梗题库” (MAME-RE 基准)

作者们收集了 10 万组“聊天内容 + 漫画回复”的组合。

  • 素材来源:全部来自一部叫《怪医黑杰克》的漫画(因为版权免费,大家都能用)。
  • 人工打分:他们找了两千多个网友,像做问卷调查一样,给每一组“聊天 + 漫画”打分:好笑还是不好笑?
  • 规模:总共收集了 50 万条人工标注,这就像给电脑准备了一本超级厚的“人类幽默教科书”。

2. 电脑的表现如何? (实验发现)

作者们让现在的顶级 AI 模型(大语言模型)来做这道题,看看谁能选出最搞笑的回复。结果发现了一些有趣的现象:

  • 现象一:AI 开始有点“懂人情世故”了
    以前的 AI 就像个死板的翻译官,只会找“意思相近”的词。比如你说“袜子破了”,它就找“破袜子”的图片。
    现在的 AI(特别是大语言模型)稍微进步了一点,它们能理解夸张反讽。比如上面那个把袜子当人看的梗,AI 能猜出这种“过度解读”是幽默的,而不仅仅是字面意思。

  • 现象二:给 AI 看图片,它反而更晕了
    这很反直觉。作者们发现,如果给 AI 既看文字又看漫画原图,它的表现并没有变好,甚至有时候变差了。
    比喻:这就好比让一个只会读剧本的演员去演戏。你给他剧本(文字),他能懂;但你把舞台布景(图片)也塞给他,他反而不知道该怎么演了。这说明 AI 虽然能“看懂”图片里有什么,但不知道怎么利用图片里的表情和场景来制造幽默。

  • 现象三:遇到“难兄难弟”就抓瞎
    这是最大的挑战。如果选项里有一张图特别搞笑,其他图都很无聊,AI 能选对。
    但如果选项里的图意思都差不多,只是幽默感有一点点细微的差别(比如一个是“冷幽默”,一个是“热幽默”),AI 就分不清了。
    比喻:就像让 AI 在一堆长得几乎一样的双胞胎里,挑出那个“最有个性”的。AI 能认出他们是双胞胎,但分不清谁更有趣。

3. 为什么这么难?

论文最后总结说,现在的 AI 在幽默感上还有两个“死穴”:

  1. 只会“看”,不会“用”:AI 能识别图片里的表情,但不知道在什么语境下用这个表情能让人发笑。
  2. 缺乏“微操”能力:幽默往往在于那一瞬间的“神转折”或“意外感”。AI 擅长找逻辑通顺的回复,但很难捕捉到那种“意料之外,情理之中”的微妙差别。

总结

这篇论文就像是在说:
“我们造了一个巨大的题库,发现现在的 AI 已经能学会一点‘接梗’了,不再是只会查字典的机器人。但是,要让它真正像个幽默的聊天高手,能精准地选出那个‘最绝’的回复,尤其是当选项都很像的时候,它还需要很大的进步。”

这就好比 AI 现在是个刚学会讲笑话的新手,能讲出大概意思,但离成为脱口秀大师,还差那么一点点“灵魂”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →