Evaluating Transformer Models for Suicide Risk Detection on Social Media
本文介绍了 kubapok 团队为 IEEE BigData 2024 Cup 进行的一项研究,该研究表明,经过微调的 GPT-4o 模型优于 DeBERTa 以及采用提示词配置的 GPT-4o,在社交媒体上的四分类自杀风险检测任务中取得了第二名的成绩。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
每年都有数十万人自杀身亡,这一悲剧往往在背后留下了未被报告的尝试记录,以及给家庭和社区带来的持久痛苦。在数字时代,人们是如何走到这一步的故事,越来越多地是在社交媒体这个公共广场上被书写的。像 Reddit 这样的平台承载着数以千计的帖子,个人在其中分享他们最黑暗的想法,有时是明确描述结束生命的计划,有时则是暗示一种无声的挣扎。对于心理健康专业人员来说,挑战是巨大的:如何在数十亿次的每日发布内容中找到这些求救信号,以及如何区分一个人是在思考自杀还是正在积极策划自杀?这正是自然语言处理领域发挥作用的地方,它利用经过训练、能够阅读并理解人类文本的计算机程序。这些工具并不能取代人类的判断,但它们提供了一种快速扫描海量信息的方法,寻找那些预示危险的特定模式。其目标并非确定性地预测未来,而是尽可能早地识别风险,从而为那些可能被忽视的人提供支持。
来自波兰的一个名为 kubapok 的研究小组最近在一次旨在改进机器检测自杀风险能力的全球竞赛中测试了这个想法。他们参加了 IEEE BigData 2024 Cup,这项挑战要求参赛者构建一个能够阅读社交媒体帖子并将它们分为四个不同类别的系统。第一个类别被称为“指标”(indicator),涵盖了提到自杀但没有表现出即时风险的帖子,例如谈论朋友的挣扎。第二个类别是“意念”(ideation),捕捉的是正在思考自杀但没有具体计划的人的帖子。第三个类别是“行为”(behavior),描述了拥有计划或正在进行自残行为的人。最后一个类别是“尝试”(attempt),专门用于描述未导致死亡的既往自杀尝试。研究人员获得了一个包含数千条来自 Reddit 的真实帖子的数据集,其中一些带有这些类别的标签,另一些则未标记,他们必须教会计算机准确地做出这些区分。
为了解决这个问题,该团队尝试了三种使用被称为 Transformer 的先进计算机模型的方法。这些是阅读了海量文本并学习了语言运作方式的大型系统。第一种方法使用了一个名为 DeBERTa 的模型,它像是一个分析文本以理解其含义的读者。团队在标记好的帖子中训练这个模型,以观察它是否能学习到这四个风险等级之间的差异。第二种方法使用了一个更庞大、更强大的模型 GPT-4o,但这一次他们没有针对特定数据进行训练。相反,他们给了模型一组示例,并要求它通过“思维链”提示(chain-of-thought prompting)进行逐步推理,希望模型的现有知识足以应对任务。第三种方法同样使用了 GPT-4o 模型,但这一次他们实际上针对竞赛的特定数据集对其进行了训练,使模型能够调整其内部设置以更好地适应手头的任务。
他们的实验结果揭示了一个明显的赢家。虽然经过训练的 DeBERTa 模型表现良好,且未经训练的 GPT-4o 模型即使在有许多示例的情况下也难以做出准确的区分,但那个经过竞赛数据专门训练的 GPT-4o 版本被证明是最有效的。这个经过微调的模型在识别每个帖子所属的正确风险类别方面达到了最高的准确率。当最终结果统计完毕时,该团队基于这个训练模型的解决方案在进入最终评估的 13 支队伍中获得了第二名,仅次于第一名。研究人员发现,训练后的模型表现得既一致又可靠,而他们的其他尝试则显示出性能上的更多波动。这一结果表明,即使是一个通用的计算机模型,只要给予一组特定的示例进行学习,就能成为识别“思考自杀”与“处于即时危险中”之间微妙差异的高效工具。
尽管取得了成功,研究人员仍谨慎地指出其系统的局限性。他们使用的数据完全来自 Reddit 上的公开帖子,收集自一个包含全球疫情期间的特定时期。这意味着该系统在其他平台或对于使用社交媒体方式不同的群体身上,效果可能不会那么好。此外,竞赛数据缺乏人类医生会使用的丰富背景信息,例如患者完整的病史或面对面的交谈。该系统只能看到单条帖子的文本,而没有周围的评论或用户之前的活动,而这些可能提供了至关重要的线索。作者认为,为了让这些工具真正发挥拯救生命的作用,未来的数据集需要建立在更严格的标准之上,或许需要通过与心理健康专业人员直接合作来验证发帖人的风险水平。在此之前,这些模型充当着强大的助手,能够从数字噪音中搜寻重要的信号,但它们并不能取代人类专家所提供的细致入微的关怀。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。