← 最新论文
💬 NLP

lmfaoooo at SemEval-2026 Task 1: Humor Is an Audience. Preference Modeling for Constrained Humor Generation

本文介绍了一个在 SemEval-2026 Task 1 (MWAHAHA) 中获得第一名的系统,该系统通过采用一种“生成多个、择优选取”的策略来应对幽默的受众依赖性,即通过一个基于人类成对判断(而非绝对幽默度评分)训练而成的偏好模型,从多样化的候选池中进行排序。

原作者: Alexey Tikhonov, Alexey Ivanov

发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Alexey Tikhonov, Alexey Ivanov

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一位喜剧俱乐部的老板,正试图为今晚的演出挑选出最有趣的笑话。你手里有由一个超快速机器人编写的一千个笑话,但你知道,一个让某人捧腹大笑的笑话可能会让另一个人翻白眼。你正在阅读的这份报告,讲述了作者如何构建一个系统来解决这个问题的,这个系统是为一项名为 Semilla-2026 Task 1(昵称 MWAHAHA)的计算机科学竞赛设计的。

以下是他们实现这一目标的步骤,通过简单的步骤进行了拆解:

1. 问题所在:“幽默”因人而异

作者指出,教计算机变得幽默之所以困难,不是因为它不会写词,而是因为“幽默”是主观的。

  • 观众问题: 一个在柏林大获成功的笑话可能会在北京冷场。即使是人类也无法就什么是幽默达成一致;如果你请10个人给一个笑话评分,他们会给出10个不同的分数。
  • 机器人问题: 计算机擅长记忆。如果你要求一个机器人讲笑话,它往往只是重复它背下来的那25个老梗,就像鹦鹉重复口头禅一样。它很难创造出真正新颖的东西。

2. 策略:“投掷飞镖,然后选中靶心”

作者并没有试图让计算机一次性写出“完美”的笑话,而是使用了两步走的策略:生成大量,然后挑选最优。

  • 第1步:“笑话工厂”(生成)
    他们建立了一个工厂,针对每一个提示词都能产出50个不同的笑话。他们使用了一组不同的AI模型(就像一个由不同喜剧演员组成的团队),并强制要求它们保持创意,以免只是简单地复制粘贴旧笑话。他们还确保了笑话符合规则(比如包含特定的词汇或保持在一定的长度内)。

    • 类比: 想象一下,你要求50位不同的厨师去做汉堡。有的会做得辣一点,有的会做得甜一点,有的会做得很奇怪。现在你拥有了一大堆汉堡。
  • 第2步:“试吃员”(选择)
    现在,他们需要从这50个笑话中选出赢家。由于人类无法实时评判每一个笑话,他们构建了一个偏好模型(Preference Model)

    • 他们没有问计算机“这个笑话有趣吗?”(这太模糊且令人困惑),而是问:“在笑话A和笑话B之间,哪一个更好?”
    • 他们利用大约 2,500 条人类投票训练了这个模型,在这些投票中,人们比较两个笑话并选出一个胜者。这就像是通过向评委展示数千场“A vs B”的对决,来训练一位评委,直到评委学会了观众的口味。

3. 秘诀:“幽默食谱”

为了让他们的“试吃员”更聪明、更容易理解,作者并没有让计算机瞎猜。他们创建了一个**“幽默基础”(Humor Basis)**——一个包含17种特定“风味”的短列表。

  • 把这想象成一个调料架。这些风味可能包括“黑色幽默”、“文字游戏”、“夸张”或“意想不到的转折”。
  • 当计算机观察一个笑话时,它不仅仅是说“好”或“坏”。它会根据调料架来检查笑话:这个笑话是否有强力的包袱?它是否在使用文字游戏?它是否太黑暗了?
  • 这使得系统具有“可解释性”,意味着人类可以查看结果并理解计算机为什么选择了某个笑话(例如:“它选了这个,是因为它有一个很棒的转折,尽管它有点短”)。

4. 结果:赢得比赛

他们在三种不同类型的数据(Reddit笑话、专业笑话以及他们自己的新数据集)上测试了这个系统。

  • 冠军: 他们的“比较两个笑话”的方法比仅仅要求计算机给单个笑话打分的效果要好得多。它在处理不同语言和文化方面也比其他方法表现得更好。
  • 奖杯: 在实际的比赛(MWAHAHA)中,他们的系统在英语和中文方面获得了第1名,在西班牙语方面获得了第2名

5. 核心启示

论文总结道,计算机幽默的未来不在于让机器人从头开始写出“更好”的笑话。机器人已经很擅长写出“很多”笑话了。真正的挑战在于选择正确的那一个。

作者认为,如果我们想要计算机变得幽默,我们应该停止将“幽默”测量为一个单一的数字,而应该开始关注偏好——通过比较选项来理解特定观众喜欢什么,就像我们在决定看哪部电影或听哪首歌时所做的那样。

简而言之: 他们构建了一个系统,生成海量的笑话自助餐,并使用一个聪明的、经过训练的“试吃员”来挑选出观众最可能喜爱的那个菜肴,通过理解幽默的核心在于观众的偏好而非笑话本身,从而赢得了比赛。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →