Causality Guided Representation Learning for Cross-Style Hate Speech Detection
该论文提出了 CADET,这是一个因果表示学习框架,通过因果图对仇恨言论生成进行建模,以解耦潜在因素并控制混杂因素,从而实现对不同风格和平台下的显式及隐式仇恨言论的鲁棒检测。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,互联网就像一个巨大的、嘈杂的集市,人们在那里大声喊出自己的想法。有时,人们会直接进行辱骂(比如“你太差劲了!”)。而有时,他们会将侮辱隐藏在笑话、讽刺或巧妙的文字游戏中(比如“噢,我真受够了独自做所有事……也许我需要一个女人来做家务”)。
目前用于捕捉这些侮辱行为的计算机程序就像是只盯着特定关键词看的保安。如果有人使用了已知的脏话,保安就会拦住他们。但如果侮辱被隐藏在笑话或刻板印象中,保安就会漏掉。更糟糕的是,如果“喊叫的风格”发生了变化(比如从嘈ola的体育场转移到安静的图书馆),保安就会感到困惑,因为他们学习的是识别声音的“音量”,而不是背后的“意图”。
这篇论文介绍了一个名为 CADET(用于跨风格仇恨言论检测的因果引导表示学习)的新系统,它试图通过像侦探一样思考,而不仅仅是作为关键词扫描器来解决这个问题。
侦探的理论:“为什么”与“如何”
作者提出了一种使用因果图(一种因果关系图谱)来理解仇恨的新方法。他们认为,要理解仇恨,必须将以下三者区分开来:
- 动机(“为什么”): 创造者伤害或贬低他人的真实意图。这是仇恨的核心。
- 目标(谁): 被攻击的群体或个人。
- 风格(“如何”): 信息是响亮直白的(显性),还是安静隐晦的(隐性)。
- 环境(上下文): 平台(如 Twitter 或 Facebook)或当前的互联网氛围。
问题在于: “环境”就像一个狡猾的魔术师。它会影响人们的写作方式(风格)以及攻击的目标。这产生了一种“伪相关”。例如,如果某个特定平台主要充斥着“隐晦”的仇恨言论,计算机可能会学习到“隐晦风格 = 仇恨”,即使这种隐晦风格实际上并不带有恶意。当这台计算机移动到一个“隐晦”含义完全不同的新平台时,它就会失败。
解决方案:CADET 的“魔法透镜”
CADET 旨在剥离噪音并寻找真相。以下是它的工作原理,并辅以一些类比:
1. 解耦(分离成分)
想象一杯由草莓、菠菜和糖组成的奶昔。目前的模型品尝整个奶昔并猜测味道。CADET 则像一台能将奶昔还原成原始成分的机器。
- 它获取一条帖子,并将动机(仇恨)、风格(糖)和目标(水果)分离开来。
- 它迫使计算机学习到,无论混合了“显性”的糖还是“隐性”的糖,“仇恨”这一成分本身才是关键。
2. 反魔术戏法(消除混淆因子)
“环境”(平台)试图欺骗模型。CADET 使用了一种叫做对抗训练的技术。想象一场“捉迷藏”游戏,其中 AI 的一部分试图向另一部分隐藏平台的身份。通过这样做,AI 能够学会忽略平台的特定特征,转而关注仇恨的普遍特征。
3. “如果……会怎样”机器(反事实推理)
这是最具有创意性的部分。CADET 会问:“如果这条带有仇恨意图的帖子是用不同的风格写的,会怎样?”
- 它在数字大脑内部,将一条带有仇恨意图的帖子的风格开关从“显性”切换到“隐性”(或反之)。
- 然后它会检查:“这个新版本仍然具有仇恨性吗?”
- 如果答案是“是”,模型就会学习到仇恨源于意图,而非风格。如果模型认为新版本是安全的,它就知道自己仍在依赖错误的线索(如特定的词汇),并且需要学习更多内容。
结果:一个更好的侦探
作者在来自各种社交媒体平台的真实数据上测试了 CADET。他们发现:
- 它能跨风格工作: 当在直接侮辱上进行训练时,CADET 仍然能够捕捉到那些隐晦、讽刺的言论。其他模型在这方面表现得很糟糕。
- 它具有鲁棒性: 即使仇恨的“风格”发生了彻底改变,CADED 也不会感到困惑。
- 它是可解释的: 不同于仅仅回答“仇恨”的“黑箱”AI,CADET 可以告诉你它为什么要标记某条帖子。它可以说:“我检测到了仇恨,因为其动机是有害的,尽管其风格很微妙。”
总结
简而言之,目前的 AI 模型就像是只允许不戴特定帽子的人进入的门卫。如果坏人换了帽子,门卫就会放行。CADET 则是一个忽略帽子,直接观察人的眼睛以判断其是否愤怒的门卫。通过使用“反事实推理”(想象不同的场景)并将“意图”与“风格”分离,CADET 创建了一个更聪明、更可靠的系统,无论仇恨如何试图隐藏,都能让互联网变得更加安全。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。