Leveraging Argument Structure to Predict Content Hatefulness
本文表明,利用 WSF-ARG+ 数据集中的论证结构标注(前提和结论)能够有效预测白人至上主义论坛消息的整体仇恨程度,其 F1 分数最高可达 96%,并为应对信息失序提供了一种有前景的方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象互联网是一个巨大而嘈杂的市场,人们在这里大声喊出各种想法。有时,这些想法完全是错误的(虚假信息),有时则是为了伤害或侮辱特定群体而设计的(仇恨言论)。通常,这两个问题会交织在一起。一个不良行为者可能会将仇恨信息包裹在“合乎逻辑”的外衣中,使其看起来像严肃的论证,从而希望你相信它。
这篇论文就像一名侦探,试图通过观察论证的构建方式,而非仅仅阅读文字,来识别这种“仇恨包裹”。
构建模块:前提与结论
将论证想象成一栋房子。
- 前提是砖块和灰浆。这些是当事人用作基础的事实或主张。
- 结论是屋顶。这是他们试图证明的核心观点。
通常,当我们试图检测仇恨言论时,我们只是审视整栋房子,问:“这栋房子看起来可怕吗?”但这篇论文提出了一个不同的问题:“我们能否仅通过观察砖块是如何堆砌的以及屋顶上写了什么,来判断这栋房子是否危险?”
实验:一个白人至上主义论坛
研究人员查看了一组来自白人至上主义论坛(一个以仇恨内容闻名的地方)的特定信息。他们拥有 227 条仇恨信息和 136 条非仇恨信息。
他们不仅仅是阅读文本;他们将每条信息拆解为其“砖块”(前提)和“屋顶”(结论)。他们还用两个特殊标签对每个部分进行了标记:
- 仇恨性:这个特定的句子是否刻薄或具有冒犯性?
- 可核查性:这是一个可以事实核查的主张(例如“天空是蓝色的”),还是仅仅是一个观点(例如“我觉得天空很美”)?
侦探工作:他们如何测试
研究人员构建了一个计算机模型(一个“智能分类器”)来预测一条信息是否具有仇恨性。他们尝试向模型输入不同类型的线索:
仅蓝图(结构):他们告诉模型:“这是砖块和屋顶的排列顺序,但没有关于它们具体内容的细节。”
- 结果:效果尚可。仅知道论证的形状就帮助模型在约 70% 的情况下做出了正确猜测。这就像知道地基歪斜的房子更可能是一栋坏房子,甚至无需看到墙壁。
蓝图 + 事实核查标签:他们添加了“可核查性”标签(告诉模型哪些部分是事实,哪些是观点)。
- 结果:令人惊讶的是,这反而使模型的表现变差。这就像给侦探一张充满过多混乱噪音的地图;对于这一特定、小型的信息组而言,简单的结构实际上更为可靠。
蓝图 + 仇恨标签:他们明确告诉模型哪些砖块和屋顶具有仇恨性。
- 结果:这是“确凿证据”。当模型知道哪些具体部分具有仇恨性时,它的准确率变得极高,在约 96% 的情况下给出了正确答案。
主要启示
该论文发现了两点主要内容:
- 结构很重要:论证的组织方式(前提导向结论的顺序)包含大量线索,表明整条信息是否具有仇恨性。你并不总是需要阅读每一个字就能获得强烈的提示。
- “砖块”讲述故事:“砖块”(前提)的仇恨性质往往足以告诉你整栋“房子”是危险的。你并不总是需要等到看到“屋顶”(结论)才知道出了问题。
对未来的警示
研究人员也指出了一个陷阱。虽然了解各部分的“仇恨标签”使模型极其准确,但在现实世界中,我们并没有现成的这些标签。我们必须自己去寻找它们。
他们还发现,添加“可核查性”(事实核查标签)并没有帮助他们的这个小型、简单模型。这就像试图用一个小放大镜去阅读一张巨大而复杂的地图;工具不足以处理额外的信息。他们建议,更大、更强大的计算机(如大型语言模型)或许能够有效利用这些事实核查标签,但目前,简单的结构是他们发现的最可靠的线索。
简而言之:通过将仇恨言论视为一座建筑并分析其各部分是如何组合在一起的,我们可以更容易地识别危险。论证本身的形状就是一个强有力的信号。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。