Harm or Humor: A Multimodal, Multilingual Benchmark for Overt and Covert Harmful Humor
本文提出了一个涵盖英阿双语及多模态(文本、图像、视频)的新基准,旨在通过区分显性与隐性有害幽默来评估模型对文化细微差别和深层推理的识别能力,并发现闭源模型表现优于开源模型,同时揭示了跨语言安全对齐的显著差距。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇论文就像是在给现在的 AI 智能体们举办一场"高级幽默感与安全测试",而且这场考试特别难,因为它专门考那些“带刺的笑话”。
想象一下,你正在教一个刚来地球的外星人(也就是现在的 AI)什么是“开玩笑”,什么是“恶意攻击”。
1. 核心挑战:为什么 AI 听不懂“黑色幽默”?
现在的 AI 很聪明,能写诗、能画图,但在理解幽默,尤其是黑色幽默(Dark Humor)时,它们经常“翻车”。
- 比喻:这就好比你在看一个只有本地人才懂的“土味段子”。
- 明面上的笑话(Explicit Harm):就像有人直接往你脸上泼了一盆脏水。AI 能一眼看到:“哦,这是脏水,这是有害的。”
- 隐晦的笑话(Implicit/Covert Harm):就像有人讲了一个关于“电梯恐惧症”的笑话,表面看是怕坐电梯,但结合文化背景,它其实是在嘲笑某种特定的社会群体或残疾。这种笑话需要文化背景和深层推理才能听懂其中的恶意。
- 现状:目前的 AI 就像个只会看字面意思的“死板翻译官”,它往往只能识别出泼脏水,却听不懂那些“话里有话”的讽刺,甚至把真正的恶意笑话当成无害的玩笑。
2. 作者做了什么?(打造了一个“魔鬼训练营”)
为了解决这个问题,作者团队(来自阿联酋和保加利亚的研究人员)自己造了一个全新的考试系统,叫"Harm or Humor"(是伤害还是幽默)。
这个考试有三个特点:
- 多模态(Multimodal):不仅考文字,还考图片(表情包)和视频。因为很多笑话是图文结合的,甚至需要看视频里的动作和语气才能懂。
- 多语言(Multilingual):不仅考英语,还重点考了阿拉伯语。
- 比喻:以前的考试只考英语,就像只教外星人说英语。但作者发现,很多文化梗在阿拉伯语里特别丰富,而 AI 在这些语言上表现很差。这次考试特意把“阿拉伯语”和“无语言障碍的通用视频”都加进来了,看看 AI 是不是真的懂文化,还是只会死记硬背英语。
- 严格分类:
- 安全(Safe):纯搞笑,没恶意。
- 有害 - 明面(Explicit):直接骂人、有脏话。
- 有害 - 隐晦(Implicit):这是最难的部分。需要结合文化背景、双关语才能看出它在歧视谁。
数据量:他们人工收集并标注了 3000 个文字笑话、6000 张图片(表情包)和 1200 个视频。这可不是机器自动抓取的,而是由 7 位来自不同文化背景的人类专家,像“挑刺”一样一个个仔细审核的。
3. 考试结果:AI 们考得怎么样?
作者把目前最厉害的 AI 模型(比如 GPT-4o, GPT-5, Gemini, 以及很多开源模型)都拉来考了考,结果发现了一些有趣的现象:
闭源模型(大公司做的):
- 它们表现最好,但也不是完美的。
- 英语 vs 阿拉伯语:在英语笑话上,它们能认出大部分恶意;但在阿拉伯语上,尤其是那些需要“动脑筋”的隐晦笑话,它们的得分大幅下降。
- 比喻:就像一个精通英语的留学生,能听懂美国人的冷笑话,但到了中东地区,面对当地特有的讽刺,他就懵了,甚至把冒犯人的话当成好话。
开源模型(大家都能用的):
- 表现普遍不如闭源模型。
- 过度谨慎(Safe Bias):很多开源模型为了“安全”,变得太胆小了。遇到稍微有点风险的笑话,它们直接判定为“安全”或者干脆拒绝回答。
- 比喻:就像一个过度保护孩子的保姆,只要孩子笑出声,她就觉得“是不是在嘲笑别人?”,于是把所有笑话都拦下了,结果导致她根本分不清什么是真笑话,什么是坏笑话。
视频模态的短板:
- 处理视频(包含声音、画面、字幕)对 AI 来说太难了。很多模型在处理阿拉伯语视频时,直接“死机”(得分为 0),因为它们连视频里的阿拉伯语字幕都读不懂,更别提理解其中的幽默了。
4. 论文想告诉我们什么?(核心结论)
这篇论文其实是在给 AI 行业敲警钟:
- 光靠“变大”没用:现在的 AI 模型越来越大,参数越来越多,但这并不等于它们变得更“懂”文化了。如果缺乏对特定文化(如阿拉伯文化)的深层理解,模型再大也是“文盲”。
- 隐晦的恶意最难防:真正的安全挑战不是那些明显的脏话,而是那些披着幽默外衣的歧视。目前的 AI 还缺乏这种“察言观色”和“深度推理”的能力。
- 需要“本地化”的安全策略:不能只用一套标准(比如英语标准)去衡量全世界。要让 AI 真正安全,必须让它学会不同文化的“潜规则”。
总结
这就好比作者给 AI 们发了一张"全球幽默安全地图",上面标出了很多 AI 容易掉进去的“坑”(隐晦的恶意笑话)。
他们发现,目前的 AI 在英语世界里还能勉强走平路,但一进入阿拉伯语世界或面对复杂的视频梗,就经常迷路甚至掉进坑里。这篇论文呼吁未来的 AI 不仅要“聪明”,更要“懂人情世故”和“尊重文化差异”,才能真正成为安全的智能助手。
一句话总结:AI 现在能听懂“哈哈”,但还听不懂“呵呵”背后的刀光剑影,尤其是在不同的文化背景下,它们还需要好好补课。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。