← 最新论文
💻 computer science

A Multi-Lingual Cyberbullying Detection and Blockchain-Integrated Privacy-Preserving Federated Learning Framework

本文提出了一种保护隐私、集成区块链的联邦学习框架,该框架利用自然语言处理和深度学习模型(特别是 BiLSTM),在确保数据安全和用户隐私的同时,检测英语、孟加拉语和孟加拉英语(Banglish)中的多语言网络欺凌行为。

原作者: Foysal Ahmad, Shoumik Karmokar, Sourave Podderr, Md. Sanowar Hossain, Md. Mahbub Or Rashid, Md. Shakil Ahmed, Sumaiya Binte Shahid

发布于 2026-08-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Foysal Ahmad, Shoumik Karmokar, Sourave Podderr, Md. Sanowar Hossain, Md. Mahbub Or Rashid, Md. Shakil Ahmed, Sumaiya Binte Shahid

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,互联网就像一个巨大且繁忙的数字游乐场,每秒钟都有数十亿人在那里聊天、分享迷因并讲述故事。这是一个连接彼此的地方,但就像任何游乐场一样,它也有“霸凌者”。这些霸凌者不仅仅是在秋千上推搡他人的孩子,而是利用几十种不同语言的伤人言语来让人们感到渺小、恐惧或愤怒的在线骚扰者。多年来,科学家们一直试图构建“数字保安”(算法)来识别这种不良行为。通常,这些保安的工作方式是将所有的聊天记录收集到一个巨大的中央保险库中进行研究。但问题在于:将每个人的私人对话都放入一个大保险库中是危险的。如果保险库被黑客攻击,或者有人偷偷窥视,每个人的秘密都会暴露。为了解决这个问题,研究人员正在探索两种新工具:联邦学习(Federated Learning),这就像是让学生在自己家里为考试复习,并且只向老师分享他们的答案(而不是笔记);以及区块链(Blockchain),它充当了一个不可破坏的公共账本,记录着过程中的每一步,使得没有人可以篡改或更改历史。大问题是:我们能否构建一个超级聪明的霸凌检测器,它能在不接触私人信息的情况下,从多种不同语言中学习,同时保持一个安全、防篡改的记录过程?

本文介绍了一个巧妙的新系统,试图正是在做这样的事情。作者们是来自孟加拉国商业与技术大学的一个团队,他们构建了一个旨在捕捉三种特定类型文本中网络欺凌行为的框架:英语、孟加拉语(孟加拉国的语言)以及“Banglish”(一种有趣的混合语言)。他们没有将所有数据窃取到中央服务器,而是使用了联邦学习。想象一个教室,每个学生都有自己的私人笔记本,里面记录着社交媒体帖子。老师(中央服务器)向每个学生发送一个“聪明的大脑”(计算机模型)。每个学生在自己的私人笔记本上训练这个大脑,学习如何识别刻薄的词汇,但他们绝不会向老师或其他学生展示他们的笔记本。他们只向老师发送“学到的教训”(更新后的数学权重)。然后,老师将所有这些教训结合起来,创造出一个超级聪明的大脑,能够识别所有这三种语言中的霸凌行为,同时在保持每个学生的私人数据都安全地留在各自口袋里的同时,保护了隐私。

为了确保在这一过程中没有人试图篡改或替换掉这些教训,团队加入了区块链技术。把这想象成一本神奇的、无法擦除的日记,每当一名学生发送他们的教训时,就会增加一页。这一页被特殊的数字封印(SHA-256 哈希算法)锁住,并通过一个解谜游戏(工作量证明,Proof-of-Work)进行验证。如果有人试图混入虚假的教训或更改过去的条目,整个链条就会断裂,系统就会察觉到异常。这确保了训练过程是透明且安全的。

研究人员测试了四种不同的“大脑”,以看看哪一个最适合这项工作:BiLSTMLSTM、**随机森林(Random Forest)**和 XGBoost。他们使用 2023 年至 2025 年间收集的 21,204 条社交媒体帖子进行了实验。结果非常明确:BiLSTM 模型成为了冠军。它在最终测试中达到了 98.43% 的惊人准确率,这意味着它几乎每次都能正确识别出霸凌行为。LSTM 模型以 94.43% 的准确率位居第二,紧随其后的是 93.20% 准确率的 XGBoost,而 随机森林 则表现稍逊,准确率为 81.76%。论文指出,BiLSTM 模型之所以获胜,是因为它可以同时进行双向阅读——通过观察特定短语前后的词汇来理解完整的上下文,这对于捕捉复杂的混合语言侮辱至关重要。

虽然该系统在这些测试中表现得非常出色,但作者们谨慎地指出,它并不是解决一切问题的万能药。他们指出,这种高度的安全性和智能化是有代价的:它需要大量的计算能力和设备间的通信。论文建议,虽然这个框架是面向未来的强大且安全的解决方案,但研究人员可能需要寻找更轻量、更快速的模型版本,以便在不减慢互联网速度的情况下,使其在日常设备上流畅运行。最终,这项研究证明了我们可以构建一个既极其聪明又严密保护用户隐私的霸凌检测器,而无需在两者之间做出牺牲。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →