← 最新论文
⚡ electrical engineering

ChildGuard: A Specialized Dataset for Combatting Child-Targeted Hate Speech

本文介绍了 ChildGuard,这是一个包含来自社交媒体平台、共计 351,877 个标注实例的大规模英文数据集,旨在通过将内容划分为三个年龄组及上下文/词汇子集,来填补针对儿童的仇恨言论检测领域的空白,并利用基于 Transformer 的模型实现了 82.07% 的最佳宏平均 F1 分数(Macro-F1 score)。

原作者: Gautam Siddharth Kashyap, Mohammad Anas Azeez, Rafiq Ali, Zohaib Hasan Siddiqui, Jiechao Gao, Usman Naseem

发布于 2026-06-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Gautam Siddharth Kashyap, Mohammad Anas Azeez, Rafiq Ali, Zohaib Hasan Siddiqui, Jiechao Gao, Usman Naseem

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,互联网是一个巨大且繁忙的游乐场。通常,我们认为游乐场是玩耍的地方,但有时,大孩子或陌生人会闯进来,对小孩子们大声说些刻薄、伤人的话。这篇论文是关于建立一个特殊的“保安”系统来识别这种霸凌行为,但有一个特别之处:它是专门为理解针对儿童(而非成年人)的霸凌形式而设计的。

以下是 ChildGuard 的故事,通过简单的语言进行了解析:

1. 问题所在:“成年人版”保安感到困惑

目前,互联网上已经有了捕捉仇恨言论的工具,但它们就像是只受过训练去识别成年人被霸凌的保安。它们知道成年人遭受侮辱时是什么样子的(例如:“你是个糟糕的政客”)。

但当霸凌者针对儿童时,侮辱的方式会发生变化。他们可能会说:“你太胖了,没法跳舞”、“滚回你的国家去”或者“去死吧,小宝宝”。这些之所以不同,是因为:

  • 针对年龄: 他们攻击孩子的成熟度或体型。
  • 具有隐蔽性: 有时,恨意并不表现为直接的脏话;它可能隐藏在讽刺或语境中(比如对一名青少年说“去玩你的玩具吧”,以此让对方感到渺小)。

论文指出,现有的工具是“以成年人为中心”的。它们忽略了针对儿童的特定细微差别,导致孩子们在最关键的成长时期处于脆弱状态。

2. 解决方案:构建一张新的“游乐场地图” (ChildGuard)

为了解决这个问题,研究人员构建了 ChildGuard。请不要把它看作是一个机器人保安,而是一个巨大的、详细的地图,记录了所有曾对孩子说过过的刻薄话。

  • 规模: 他们收集了近 352,000 个文本示例。这就像读完了一座小城市整整一年的报纸。
  • 来源: 他们从三个主要的“游乐场”收集了这些数据:X (Twitter)RedditYouTube
  • 分类: 他们并没有把数据乱堆在一起。他们将数据分成了三个年龄组,就像学校对学生进行分类一样:
    • 年幼儿童(11岁以下): 被针对时常出现“宝宝”、“幼儿”或“尿布”等词汇。
    • 前青少年期(11-12岁): 被针对时常出现“女学生”或“未成年人”等词汇。
    • 青少年(13-17岁): 被针对时常出现“青少年”或“高中生”等词汇。

他们还将数据分为两种“刻薄”类型:

  1. 词汇层面(“耳光”): 使用脏话进行的直接侮辱(例如:“你是个没用的小鬼”)。
  2. 语境层面(“耳语”): 只有当你理解整个对话或情境时才能理解其含义的恶意(例如:讽刺或间接威胁)。

3. 隐私盾牌

在任何人查看这些数据之前,研究人员都戴上了“隐私护目镜”。他们清除了所有真实姓名、用户名和位置。如果发现了名字,他们会用随机代码进行替换。这确保了他们是在研究“霸凌行为”本身,而不是暴露“受害者”。

4. 测试:现有的机器人表现如何?

研究人员利用这张新地图(ChildGuard)测试了当今最智能的 AI 计算机(如 GPT-4、Claude 等)。他们想看看这些 AI 是否能识别出霸凌行为。

结果喜忧参半:

  • 好消息: 最优秀的 AI 答对了大约 82% 的问题。这是一个不错的成绩,但并不完美。
  • 坏消息: 当 AI 尝试应对特定挑战时,得分显著下降:
    • 年幼儿童: 识别针对 11 岁以下儿童的霸凌变得更难了(得分降至约 75%)。
    • 语境化仇恨: 与“耳光”(直接侮辱)相比,AI 在处理“耳语”(讽刺/间接恨意)时表现得更为吃力。
    • 跨平台: 它在 Reddit 上表现良好,但在 YouTube 上表现较差。

它们为什么失败了?
论文发现,AI 感到困惑主要是因为:

  • 隐藏的恨意: 当霸凌并不明显时。
  • 语境: 当含义取决于整个对话时。
  • 年龄混淆: 当很难分辨侮辱是针对儿童还是成年人时。

5. 核心结论

论文得出结论:虽然我们拥有强大的 AI 工具,但它们目前还不足以完全保护网络上的儿童。它们仍然过于“以成年人为中心”。

ChildGuard 是一个全新的、专门化的工具(一个数据集),研究人员可以用它来训练更优秀、更敏感的 AI 保安。它强调了保护儿童在线上的心理健康需要理解:一个对着 7 岁小孩说话的霸凌者,其说话方式与对着 40 岁成年人说话的霸凌者是非常不同的。

简而言之: 我们建立了一个巨大的图书馆,记录了孩子们在网上是如何被霸凌的,目的是为了教会我们的计算机:说“你是个宝宝”不仅是一种描述,也可以是一种仇恨犯罪;同时也让我们明白,我们的计算机仍在学习的过程中。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →