STEMTOX: From Social Tags to Fine-Grained Toxic Meme Detection via Entropy-Guided Multi-Task Learning
本文介绍了包含 6,300 个带有社会标签的标注模因的 TOXICTAGS 数据集,并提出了 STEMTOX,这是一个熵引导的多任务学习框架,利用这些标签显著提升了基于视觉 - 语言模型的细粒度有毒模因检测效果。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象互联网是一个巨大而混乱的数字广场。在这个广场上,人们不仅仅交谈;他们分享“模因”(memes)——带有有趣(有时也带有恶意)配图的图片,这些图片像野火一样迅速传播。虽然许多模因是无害的笑话,但有些却像隐藏的地雷:它们看起来是笑话,实际上却在传播仇恨、危险或毒性。
论文STEMTOX是一套新工具包,旨在帮助“城镇守卫”(内容审核员)更准确地识别这些危险地雷。以下是其构建方式的简明解释:
1. 问题:“笑话”陷阱
检测有毒模因之所以困难,是因为它们很狡猾。一张图片可能展示的是卡通角色,但下方的文字却是编码后的侮辱。当前的计算机程序(称为 AI 模型)往往难以捕捉这些细微差别,因为它们是在陈旧、简单的数据上训练的,或者只查看图片而不理解其“氛围”或背景。
2. 新地图:TOXICTAGS 数据集
为了解决这个问题,研究人员构建了一张名为TOXICTAGS的高质量互联网新地图。
- 真实世界的燃料:他们并非凭空捏造虚假示例,而是从互联网上收集了 6,300 个真实的模因。
- 两步分类:他们不仅仅问:“这个内容是否有害?”而是采用了一个两步流程:
- 第一步:这篇帖子是有毒的还是正常的?(就像保安检查行李。)
- 第二步:如果它确实有毒,那么它是哪种类型?是仇恨性(攻击某个群体)、危险性(宣扬暴力或自残),还是仅仅冒犯性(粗鲁但不一定危险)?
- 秘密 ingredient(标签):这里最大的创新在于,每个模因都附带了一份“社会标签”列表(如 #希特勒、#校园枪击、#芝麻街)。把这些标签想象成背景线索或围绕模因的“窃窃私语”。它们告诉 AI 这个模因真正关乎什么,即使图片看起来是无害的。
3. 新侦探:STEMTOX
研究人员构建了一个名为STEMTOX的新 AI 框架。你可以把它想象成一名侦探,使用一种名为“熵引导多任务学习”的特殊技巧。
“熵”技巧(寻找最冷静的声音):想象一个房间里挤满了人,他们针对一起案件大喊着不同的理论。有些人困惑,有些人在猜测,而有些人则非常确定。“熵”是一种衡量 AI 困惑程度或“噪音”大小的方法。STEMTOX 观察 AI 的内部脑层,选择 AI最不困惑(熵最低)的时刻来做出最终决定。它忽略噪音,倾听最自信的信号。
“多任务”技巧(同时做两件事):通常,AI 被训练只做一件事:“这是否有害?”STEMTOX 则被训练同时做两件事:
- 分类:判断其是否有害。
- 生成:构思出解释为何有害的社会标签(如 #希特勒 或 #9/11)。
类比:这就像训练一名学生不仅要通过考试,还要编写学习指南。通过迫使 AI“编写标签”(解释背景),它学会了更深入地理解模因,从而更擅长识别毒性。
4. 结果:更聪明的守卫
当他们测试 STEMTOX 时:
- 它更擅长识别有害内容:通过使用标签和“双任务”训练,与之前的模型相比,AI 在区分无害笑话和仇恨内容方面表现大幅提升。
- 它也能在旧地图上工作:即使在其他现有的数据集(没有标签)上测试,它的表现仍优于其他顶级方法。这表明“通过解释进行训练”的方法使 AI 在总体上变得更聪明。
- 它发现了隐藏的模式:分析显示,有毒模因经常使用特定的标签组合(例如将“希特勒”与"9/11"混合,或在黑暗语境中使用“芝麻街”角色)来隐藏其真实意图。STEMTOX 学会了识别这些模式。
总结
简而言之,作者意识到要捕捉有毒模因,不能只看图片;必须理解背景。他们建立了一个包含真实模因及其背景线索(标签)的大型新图书馆,并教导一名新的 AI 侦探在评判模因的同时解释它。这种“通过解释来教学”的方法,使 AI 在识别那些试图躲在笑话背后的有害内容方面变得更加敏锐。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。