← 最新论文
💬 NLP

BioSentinel at EXIST 2026: Soft-Label Optimization with XLM-RoBERTa for Sexism Intent Classification in Memes

BioSentinel 团队的论文详细阐述了他们参与 EXIST 2026 Task 2.2 的情况,其中他们采用了一个基于 XLM-RoBERTa 的模型,该模型通过使用复合损失函数来有效平衡用于分类模因中性别歧视意图的软标签和硬标签预测,并最终在 CLEF 2026 评估中取得了特定的排名。

原作者: Chandru Munisamy, Karthikeya Raguveer, Alapan Kuila

发布于 2026-07-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Chandru Munisamy, Karthikeya Raguveer, Alapan Kuila

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,互联网就像一个巨大而混乱的城市广场,每个人都在那里大声叫喊、窃窃私语,并在墙上涂鸦。有时,这些图片(被称为“迷因”或“梗图”,即 memes)只是有趣的笑话,但有时,它们也隐藏着难以察觉的针对性别的恶意评论。这就是性别歧视检测的世界,它是计算机科学的一个分支,旨在教机器如何“察言观色”,理解一个笑话是无害的还是具有伤害性的。

但难点在于:人类并不总是对什么是“冒犯”达成共识。一个人可能认为某个迷因是直接的侮辱,另一个人可能认为它只是一个微妙的讽刺笑话,而第三个人可能根本看不出有什么问题。这种现象被称为分歧(disagreement)。在过去,计算机被教导去选择一个唯一的“正确”答案,就像老师批改试卷时使用单一的标准答案一样。然而,这篇论文指出,当人类无法达成一致时,计算机不应该仅仅猜测一个答案,而应该学习理解观点的分布,就像天气预报说“有 60% 的降水概率”,而不是只大喊“正在下雨!”这种方法被称为带有分歧的学习(Learning with Disagreement),它能让机器变得更具细微洞察力,且不再过度自信。


BioSentinel 团队的任务:读懂文字,忽略图片

见见 BioSentinel 团队,这是一群参加了名为 EXIST 2026 的高规格竞赛的研究人员。他们的挑战是?构建一个机器人,能够观察迷因并判断创作者是在进行直接攻击(明显的性别歧视)、评判性攻击(使用讽刺或微妙暗示),还是(并非性别歧视)。

转折点在于:比赛不仅要求机器人选择一个标签,还要求它输出一个概率分布——这是一种高级说法,意为:“我有 70% 的把握认为这是直接攻击,20% 的把握认为是评判性攻击,以及 10% 的把握认为它是无害的。”这模拟了一组人类评委对同一个迷因产生不同投票意见的情况。

策略:纯文本侦探

由来自印度的 Chandru Munisamy 及其伙伴领导的团队决定玩一个非常特定的游戏。尽管迷因是带有文字的图片,但他们选择完全忽略图片。他们的行为就像一名只阅读对话转录文本、忽略面部表情和肢体语言的侦探。

为什么这么做?他们想看看是否可以在不被杂乱的视觉部分干扰的情况下,通过理解文字标签的不确定性来达到极高的水平。他们使用了一个强大的语言大脑——XLM-RoBERTa(一个拥有 2.7 亿参数、能同时理解英语和西班牙语的模型),并教会了它一个特殊的技巧。

他们没有只是告诉模型“这就是答案”,而是给了它两种类型的“家庭作业”:

  1. 软作业(The Soft Homework): “这是人类投票的结果。请尝试匹配这种精确的观点组合。”他们使用了一个名为 KL 散度(KL Divergence) 的数学工具,使模型的预测结果看起来与人类的投票模式一致。
  2. 硬作业(The Hard Homework): “这是投票中的官方获胜者。确保你也掌握了这个正确答案。”他们使用了标准的加权交叉熵(Weighted Cross-Entropy),以确保模型不会过于困惑。

通过混合这两种课程(70% 软,30% 硬),他们希望创造出一个既准确又具备人类分歧意识的模型。

结果:稳健但并不完美的表现

当 BioSentinel 团队在官方考试(测试集)上测试其系统时,情况如下:

  • 软标签得分(Soft-Label Score): 他们取得了 0.3229 的成绩(称为 ICM-Soft-Norm)。这优于仅通过“猜测最常见答案”的机器人,后者的得分为 0.2835
  • 硬标签得分(Hard-Label Score): 在选择单一最佳答案方面,他们的 F1 分数达到了 0.4236
  • 排名: 在提交软标签预测的 118 支队伍中,他们排名第 40 位。在提交硬标签预测的 187 支队伍中,他们排名第 49 位。

团队发现,他们的“混搭式”训练方法确实有效。当他们移除“软”课程(KL 散度)时,他们匹配人类观点的能力大幅下降(从 0.312 降至 0.142)。当他们移除“硬”课程时,他们在单一答案上的准确率也会下降。这种结合才是他们成功的关键。

“评判性”之困

然而,这个机器人有一个盲点。它很难识别评判性的性别歧视(即那种微妙、讽宜性的歧视)。它在该特定类别上的得分非常低,仅为 0.071

为什么会这样?团队意识到,由于没有图片,机器人错过了“笑点”。许多此类迷因依赖于视觉上的笑话——比如某种漫画形象或特定的面部表情——而仅凭文字无法解释这些内容。例如,一段文字说“坐在你的家庭餐桌旁……”看似平淡无奇,但如果配图显示父亲得到了最大的鱼而母亲只得到最小的一条,那么这个笑话就很明显了。没有了图像,机器人看到的只是一个中性的句子。

团队还注意到机器人学习过程中的一个有趣现象。在训练的前两天,它甚至一次也没有猜中过“评判性”这一类。直到它已经学会了如何区分“无害”和“直接”之后,它才开始理解这个棘手的类别。这表明,微妙的内容是最难学习的,可能需要更多的时间或特殊的训练。

他们没做的事情(以及为什么这很重要)

这篇论文非常诚实地说明了他们没有做的事情。他们没有尝试使用比赛组织方提供的脑电波(EEG)数据或眼动追踪数据。原因在于,这些数据在训练集和测试集之间并不匹配。他们也没有尝试使用更大、更复杂的模型,因为在他们特定的设置下,那些模型会变得不稳定且令人困惑。

他们还测试了一个“温度(temperature)”设置(一个可以让机器人的预测变得更确定或更不确定的旋钮)。在练习测试中,将这个旋钮调至 0.7 使机器人的预测更符合人类观点(将得分从 0.317 提升到 0.326),并使其置信度更加符合现实。然而,在最终的官方测试中,为了保险起见,他们坚持使用了标准设置。

总结

BioSentinel 团队展示了只要你教会机器尊重人类的分歧,仅靠文本就能构建出一个不错的性别歧视检测器。通过结合“软”与“硬”两种课程,他们创造出了一个比传统方法更能理解人类观点灰色地带的模型。

但论文也向我们发出了警告:如果你想捕捉那些隐晦、讽刺的笑话,你不能只读文字。你需要看到图片。机器人对“评判性”类别的挣扎证明了,有时视觉语境是让笑话(或侮辱)产生意义的唯一要素。团队建议,未来的机器人应该尝试同时观察文字和图片,以获取完整的信息。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →