← 最新论文
💬 NLP

ToxSyn-PT: A Synthetic Fine-Grained Dataset of Minority-Targeted Toxic Language in Portuguese

本文介绍了 ToxSyn-PT,这是首个大规模、合成的葡萄牙语数据集,其特点是针对九个少数群体提供了细粒度的多标签仇恨言论标注以及必要的非毒性反例,揭示了基于社交媒体数据训练的模型无法泛化到特定少数群体的语境中,并强调了标准评估指标的局限性。

原作者: Iago Alves Brito, Julia Soares Dollis, Fernanda Bufon Farber, Diogo Fernandes, Arlindo R. Galvão Filho

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Iago Alves Brito, Julia Soares Dollis, Fernanda Bufon Farber, Diogo Fernandes, Arlindo R. Galvão Filho

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人如何识别操场上的霸凌者。长期以来,研究人员只能通过英语操场的例子来教这个机器人,即便如此,他们也大多只是向机器人展示那些大声叫嚣的显而易见的霸凌者。他们很少向机器人展示那些隐蔽、狡猾的霸凌者——即那些将恶毒言语隐藏在玩笑或“只是提个问题”之下的霸凌者。

现在,想象一下你要教这个机器人理解葡萄牙语。问题在于,几乎没有好的教科书(数据集)能够展示针对特定群体的恶意攻击与关于这些群体的正常友好对话之间的区别。

这篇论文介绍了 ToxSyn-PT,这是一个专门为解决这一问题而创建的全新、大规模“教科书”。以下是作者如何构建它以及他们的发现,通过简单的解释呈现如下:

1. 问题所在:“一刀切”的失败

把现有的葡萄牙语仇恨言论数据集想象成一个只包含**推特(Twitter)**书籍的图书馆。如果你用只有推特书籍训练你的机器人,它会成为识别社交媒体上常见的愤怒叫嚣方面的专家。

然而,作者发现,当他们把这个“经过推特训练”的机器人放到另一个房间(比如新闻评论区或正式讨论场合)时,它会变得完全失明。它无法识别那里的仇恨言论,因为“霸凌者的语言”会根据所在的房间而改变。

  • 类比: 这就像是只通过看动物园里的狼来教学生识别“狼”。当这个学生进入森林时,他们认不出那头狼,因为在野外它的样子看起来完全不同。

2. 解决方案:构建一个合成的“训练健身房”

由于缺乏足够的关于针对特定群体(如黑人、女性、LGBTQIA+群体、老年人等)的真实葡萄牙语仇恨言论案例,作者决定使用人工智能来构建他们自己的例子

他们创建了一个由四个步骤组成的流水线(pipeline)来生成 53,000 个句子:

  • 第一步:种子(The Seed)。 他们从一个极小的、高质量的人类编写示例集开始,这些示例涵盖了关于两个群体的正面和负面内容。
  • 第二步:扩张(Expansion)。 他们使用人工智能(GPT-4)观察这些“种子”,并针对九个不同的少数群体写出数千个新的变体。
  • 第三步:改写(Paraphrasing)。 他们将这些新句子以不同的风格进行重写。至关重要的一点是,他们不仅写了坏话,还针对同样的群体写了好话。这对于教学至关重要,因为它教会了 AI 如何区分是对一个群体的“仇恨”还是仅仅在“谈论”一个群体。
  • 第四步:丰富化(Enrichment)。 他们加入了更复杂、更微妙形式的偏见(例如“歧义性偏见”,即仇恨隐藏在双关语或弦外之音中),以增加训练难度并使其更完善。

结果: 一个规模宏大且完美平衡的数据集。它拥有刻薄的句子、友好的句子和中性的句子,并且所有句子都标注了精准的攻击目标以及所使用的“修辞技巧”(如讽刺或受害者责备)。

3. 重大发现:“灾难性失败”

作者将他们的新 AI 模型与旧模型进行了对比测试。结果令人震惊:

  • 旧模型: 当他们尝试使用基于通用社交媒体训练的模型来检测这个新且特定的数据集中的仇恨言论时,这些模型表现得极其糟糕。它们几乎漏掉了所有的仇恨言论。
  • 新模型: 当他们在 ToxSyn-PT 上训练模型时,这些模型在自己的“健身房”里表现出色,但当被测试在旧的社交媒体数据上时,它们也失败了。

隐喻: 这就像是训练一名游泳运动员去参加泳池比赛。他们成为了世界级的泳池选手。但如果把你放到大海里,他们会溺水。反之,如果你在海洋中训练他们,他们在泳池里就无法游泳。因为“水”(语境)实在太不一样了。

这证明了仇恨言论并不是单一的存在。它会根据被攻击的对象以及对话发生的场所而改变。作者还警告说,标准的“计分卡”(如 Macro F1)可能会产生误导;一个机器人可能获得很高的整体得分,但在执行其最重要的任务——识别它本该发现的特定仇恨时,却会彻底失败。

4. 为什么这很重要

这篇论文并不声称已经永远解决了仇恨言论问题。相反,它为葡萄牙语 AI 提供了一个首个高质量的“健身房”,让 AI 学习如何区分真正的仇恨与对少数群体的正常讨论。

  • 之前: 研究人员必须靠猜测,或者使用微小且不平衡的数据集,从而错失了其中的细微差别。
  • 现在: 他们拥有了一个庞大的、平衡的资源,其中包含了必要的“正面”示例,用以教会 AI 哪些内容不应该被标记为仇恨。

作者公开了该数据集,以便其他研究人员可以利用它来构建更优秀、更谨慎的 AI 系统,使之能够理解葡萄牙语中针对弱势群体的那些微妙且危险的仇恨表达方式。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →