Context-Aware Detection and Victim-Centered Response Generation for Online Harassment in Private Messaging
本研究提出了一种情境感知、以受害者为中心的人工智能框架,该框架利用在私人 Instagram 消息数据集上训练的大型语言模型,以更准确地检测网络骚扰并生成在情感支持和降级方面优于人类反应的、具有心理支持性的回应。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,把你的私人短信当作一本只有你和朋友能读的秘密日记。现在,想象有人利用这本日记来说出刻薄、可怕或伤人的话。这篇论文讲述的是如何构建一个智能助手(人工智能),让它能够阅读这些秘密日记以识别欺凌行为,进而帮助被欺凌者想出该如何回应。
以下是研究人员所做工作的故事,分解为几个简单的部分:
1. 问题:“私密房间”与“公共广场”
大多数旨在阻止网络欺凌的计算机程序,就像站在繁忙公共广场(如 Twitter 或 Facebook)上的保安。它们关注的是喧闹的公开喊叫。
但欺凌往往发生在私密房间(如 Instagram 私信)中。在这些私密空间里,欺凌行为是隐蔽的。它不仅仅是一句刻薄的话;而是一整段对话,其含义会根据五分钟前说过的话而改变。这就像“传声筒”游戏,只有当你了解整个故事时,玩笑才会变成威胁。由于这些对话是私密的,计算机通常无法看到它们,也难以理解其中的语境。
2. 数据:窥探真实生活
为了训练他们的计算机,研究人员请 26 名青少年(12 至 18 岁)分享他们的 Instagram 私人消息。其中一些青少年正经历非常艰难的时期,包括有自杀念头。
- 收集:他们收集了超过80,000 条消息。
- 标注:人类阅读了这些消息,找出了 41 个实际发生欺凌的具体实例。他们必须阅读整段对话,才能判断某条消息是欺凌行为,还是朋友间的玩笑。
3. 第一部分:“侦探”(识别欺凌)
研究人员尝试训练人工智能成为一名侦探。
- 旧方法:他们尝试使用标准的“毒性检测器”(就像机场的金属探测器)。这些检测器擅长在公开帖子中识别响亮、明显的脏话,但在私密聊天中却失败了,因为它们无法理解语境。
- 新方法(级联):他们建立了一个两步走的“侦探团队”。
- 侦探 A 阅读该消息以及之前的 50 条消息。如果看起来可疑,它就发出标记。
- 侦探 B 是“首席督察”。它查看侦探 A 的标记,并问道:“你确定吗?这真的是欺凌,还是只是一个奇怪的玩笑?”
- 结果:这个两步团队比旧检测器更能有效地发现欺凌行为。它们识别出了 60% 的欺凌案例,同时保持了较低的误报率。关键在于,人工智能阅读了整个故事,而不仅仅是最后一句话。
4. 第二部分:“教练”(帮助受害者)
一旦人工智能识别出欺凌,下一个问题就是:受害者应该如何回应?
研究人员构建了第二个人工智能,它充当一名支持性教练。
- 策略:人工智能不是随机撰写回复,而是先决定一种策略(例如“保持冷静”、“设定界限”或“表达同理心”)。然后,它根据该策略撰写消息。
- 风格检查:研究人员要求人工智能听起来像个青少年(使用俚语、短句和随意的语气),以免听起来像机器人或老师。
- 测试:研究人员向人类评委展示了 100 个欺凌场景。他们展示了两个选项:
- 真正的青少年实际写下的回复。
- 人工智能写下的回复。
裁决:
- 帮助性:评委们压倒性地更喜欢人工智能的回复。他们觉得人工智能的回复更能制止争吵、平息事态,并让受害者感到受到支持。
- 自然度:然而,评委们觉得真实青少年的回复听起来更“自然”和真实。人工智能在提供帮助方面很出色,但有时与真实青少年的说话方式相比,略显生硬。
5. 核心理念:“合成缓冲”
这篇论文提出了一个很酷的概念,称为**“合成缓冲”。
想象一下,你正处于激烈的争吵中,愤怒或恐惧让你大脑一片空白。你不知道该说什么。
人工智能就像一个缓冲垫或盾牌**。它承担情况的情感重负,找出最好的说法,并为你起草回复。然后你可以阅读它、修改它,或者发送它。它不会取代你;它是在你失去声音时,帮助你找回声音。
他们声称的要点总结
- 语境为王:如果不阅读整段对话,就无法在私密聊天中发现欺凌。
- 两步检测:两个人工智能组成的团队比单个团队更能准确识别欺凌,而不会误报。
- 人工智能作为教练:人工智能生成的回复比受害者在情绪激动时通常想到的回复更具帮助性和安抚性。
- 权衡:人工智能的回复非常有帮助,但有时听起来不如人类回复那样“真实”。
重要提示:论文谨慎地指出,这是一个辅助工具,而非人类朋友、父母或专业帮助的替代品。它的目的是在受害者遭受网络伤害时,提供“即时”的助力。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。