The methodology of Constructing the Large-Scale Dataset for Detecting Presuicidal and Anti-Suicidal Signals in Social Media Texts in Russian
本文提出了一种构建包含超过50,000条已标注文本的大规模俄语社交媒体数据集的全面方法论,用于检测自杀倾向及反自杀信号,详细阐述了从指令创建到验证的全过程,并向公众提供了该数据集、代码以及初步的分类结果。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,互联网是一个巨大的、繁忙的数字广场,每秒钟都有数百万人在这里分享他们的想法、笑话和最深层的秘密。在这个嘈杂的人群中,有些人正在无声地呼救,发出关于绝望或想要结束生命的微妙暗示。多年来,科学家们一直试图构建“数字侦探”——能够阅读这些社交媒体帖子并捕捉危险迹象的计算机程序,赶在为时已晚之前发现它们。这个被称为自然语言处理(NLP)的领域,就像是在教机器人通过阅读文字来理解人类的情感。但棘手之处在于:除非经过大量已被人类标记为“悲伤”、“愤怒”或“处于危险中”的示例库的训练,否则计算机很难猜透情感。如果没有这些精心策划的库,计算机就只是在黑暗中盲目猜测。
这正是来自俄罗斯的一个研究小组所应对的挑战,他们决定为一个非常严肃的任务建立一个庞大的、专门化的库:寻找俄罗斯社交媒体中的自杀风险信号。他们不仅仅想寻找那些感到悲伤的人;他们想要区分那些正滑向自我伤害(自杀倾向信号)的人与那些正在寻找坚持下去的理由(反自杀信号)的人。把这想象成在分拣一大堆混杂在一起的邮件:有些信件是紧急的求救信号,有些是对未来的充满希望的笔记,而大多数只是普通的垃圾邮件。研究人员花费数年时间制定了一套严格的规则手册,培训了一支人类“分拣员”团队,并建立了一个包含超过 57,000 个文本示例的数据集,以教会计算机如何辨别差异。他们的工作表明,虽然这项任务极其困难且具有主观性,但一个结构良好的数据集可以帮助计算机更好地识别这些救命的信号。
使命:大海捞针
研究人员从一个简单但可怕的现实开始:自杀是一个重大问题,许多挣扎中的人在采取行动之前会在网上表达出来。然而,这些求救信号被埋没在如山般的无关帖子中——表情包、对天气的抱怨以及随机的想法。为了帮助人类更快地找到这些人,团队需要一种方法来训练计算机过滤掉这些噪音。
他们着手为俄语中的自杀文本制作一本“罗塞塔石碑”。他们的目标不仅是说“这个人很悲伤”,而是要分类其背于悲伤的具体原因。这个人是感到绝望吗?他/她是否遭受了欺凌?他/她是否有计划?或者相反,他/她是否在谈论对家人的爱或对明天的计划?这些就是“反自杀信号”——生存的理由。
制定规则手册:说明书
在他们能够训练计算机之前,必须先教导那些负责标注数据的专业人员。这是项目中最微妙的部分。研究人员意识到,要求人们阅读数千条令人沮丧的帖子可能会造成情感上的消耗,因此他们建立了一个安全网。他们创建了一份详细的说明手册,作为标注员(进行标注的人)的地图。
这份手册包括:
- “情绪板”分类: 不仅仅是“悲伤”或“不悲伤”,他们创建了 33 个具体的危险信号类别(如“死亡念头”、“酒精问题”或“家庭破裂”)和 12 个希望信号类别(如“表达爱意”或“积极的自我评价”)。
- “第一人称”规则: 一个至关重要的规则是,文本必须是关于作者本人的。如果有人写道:“我的朋友想死”,那是无关的。如果他/她写道:“我想死”,那就是一个信号。这条规则非常严格,以避免误报。
- 情绪检查: 在每一批次工作前后,标注员都必须进行测试以检查自身的心理健康状况。如果他们感到过于崩溃,会被告知立即停止。
人类因素:整理混乱
团队招募了一群标注员,包括机器学习专家和普通人,来标注超过 57,000 个文本示例。他们并没有直接将数据丢给他们;而是使用了一种智能采样策略。他们将数据分成块,并使用初步的计算机模型来猜测哪些文本可能具有研究价值,从而确保获得不同类型帖子的良好混合。
这个过程是混乱且充满人性化的。研究人员发现,即使有严格的规则手册,人们也会产生分歧。一个人可能将一个隐喻视为求救信号,而另一个人则认为它只是一个比喻。为了处理这个问题,他们使用了“软多数投票”系统。如果三个人对一条帖子进行了标注,且其中两人对某个特定的危险信号达成一致,那么该标签就会生效。这种方法使他们能够在不纠结于每一个细微分歧的情况下,保持数据的丰富性和多样性。
他们还发现,“无关”的帖子是最难处理的。有时,一条帖子听起来很危险,但实际上只是关于书中人物的故事或电影台词。团队不得不回去重新标注数千个这样的“不确定”示例,完善他们的规则,以确保计算机不会被第三方的故事所迷惑。
结果:教导计算机
一旦数据经过清洗和标注,团队便训练了一个计算机模型(具体是一个名为 RuBERT 的模型)来阅读这些文本。他们通过不同的方式测试了该模型:
- “大局观”测试: 模型能否区分“危险”、“希望”和“无意义”?可以,而且表现得相当不错,得分约为 0.71。
- “细节”测试: 模型能否区分“内疚感”和“绝望感”?这更难了。当被要求过于具体时,模型的表现变得吃力,这表明对于计算机来说,识别整体情绪比识别精确的细微差别更容易。
实验表明,类别越具体,模型学习的难度就越大。然而,当模型被允许将相似的情绪归为一类时,表现最为出色。这表明,虽然计算机可以学会识别危险的一般迹象,但人类情感的精细细节对它们来说仍然是一个谜。
这意味着什么
这篇论文并不声称已经解决了自杀检测的问题。相反,它提供了一个强大的工具:一个大规模、精心构建的数据集和一套成熟的创建方法。研究人员发现,最大的障碍在于那些“灰色地带”——即模糊、具有隐喻性或关于他人的文本。他们还强调,相比于危险信号,“反自杀”信号(生存的理由)更难被模型学习,这可能是因为关于“希望”的类别过于抽象。
最终,这项工作是一个基础。它是一个巨大的、开放的俄语社交媒体帖子库,任何人都可以利用它来构建更好的工具。作者建议,未来的工作可以使用更智能的 AI 来辅助标注,并且需要不断完善规则,以处理人类语言中那些复杂且具有主观性的部分。他们已经公开了数据、代码和指令,邀请他人加入这一努力,共同构建一个更准确、更具同理心、并最终能提供更多帮助的数字安全网。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。