← 最新论文
💻 computer science

Grey Wolf Optimizer-Based Feature Selection with Mutual Information Refinement for Machine Learning-Based Bot Detection on Social Media

本研究提出了一种基于灰狼优化算法并由互信息进行精细化改进的特征选择框架,旨在有效降低社交媒体机器人检测中的特征空间,并在一个包含 8,386 个账号的数据集上,利用 XGBoost 实现了 98.87% 的分类准确率。

原作者: Aditya Vardhan, Mohit Yadav, Amarjeet Singh Chauhan, Sanjay Saini

发布于 2026-08-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Aditya Vardhan, Mohit Yadav, Amarjeet Singh Chauhan, Sanjay Saini

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在广阔且嘈杂的社交媒体景观中,一个隐蔽但重大的问题已经扎根:自动化账号,即“机器人”(bots)的兴起。这些是旨在模仿人类用户的软件程序,通过发布消息、点赞内容和关注他人,来传播从无害的新闻更新到危险的虚假信息及垃圾信息的各种内容。虽然其中一些自动化账号具有合法的用途,但许多则是恶意的,能够左右公众舆论并破坏在线社区的信任。多年来,研究人员一直试图构建能够区分真实人类与机器人的系统。挑战在于海量的数据;社交媒体平台生成数以百万计的用户资料,每个资料都拥有数十个不同的特征,从发送推文的数量到用户名的长度不等。在这些信息中筛选出真正重要的少数线索,就像是在试图于一堆不断增长且变化的干草堆中寻找一根特定的针。

印度达雅尔巴格教育学院(Dayalbagh Educational Institute)的一个研究小组开发了一种新方法来解决这个排序问题,旨在使机器人检测变得更快速、更准确。他们并没有将关于用户的每一项信息都输入计算机程序,而是创建了一个两步走的过程,以剔除噪声并仅保留最具代表性的细节。他们的方法结合了一种受自然启发的搜索策略和一种衡量一项信息能告诉我们多少关于另一项信息之内容的统计方法。通过使用这种混合技术,他们能够将包含六十八个不同用户特征的大规模列表缩减为一个更小、更强大的二十五个特征的组合,并最终精简为证明在识别方面最有效的十个特征。

研究人员首先使用了一个包含 8,386 个 Twitter 账号信息的庞大数据集,其中一半是已知的机器人,另一半是真实的人类。每个账号都由六十八个不同的特征进行描述,例如关注者数量、转发频率以及用户简介的长度。为了找到这些特征的最佳组合,团队首先采用了名为“灰狼优化算法”(Grey Wolf Optimizer)的方法。这是一种模拟灰狼社会等级制度和狩猎行为的计算机算法。在数字版本中,一群“狼”探索各种可能的特征组合空间,其中最好的解决方案会带领族群向最有希望的区域前进。这个过程充当了一个过滤器,将最初的六十八个特征缩小到了一个更易于管理的二十五个特征的集合,这些特征在区分机器人与人类方面展现出了最大的潜力。

一旦确定了这组二十五个特征,研究人员就应用了第二层精炼,使用了被称为“互信息”(Mutual Information)的概念。可以将其理解为一种衡量两个事物之间关联紧密程度的方法;在这种情况下,它衡量了了解特定用户特征在多大程度上有助于预测该用户是否为机器人。通过根据这种关系对这二十五个特征进行排名,团队可以观察哪些特征是真正必不可少的,而哪些仅仅是冗余的。他们测试了从前四名到前二十名不等的不同特征组大小,以观察需要多少个特征才能获得最佳结果。这一步确保了最终的特征列表不仅规模小,而且充满了最相关的有效信息,剔除了可能干扰检测系统的任何剩余杂质。

为了验证这种精简的方法是否真的奏效,研究人员将其与五种不同类型的机器学习模型(即经过训练以识别模式的计算机程序)进行了对比测试。他们使用了诸如决策树和支持向量机等标准工具,但也包括了一个被称为 XGBoost 的强大模型。结果显示,通过使用他们精炼后的特征列表,系统表现得异常出色。特别是 XGBoost 模型,在使用仅八到十二个特征的子集时,实现了 98.87% 的分类准确率。这意味着该系统几乎在每一种情况下都能正确识别账号是机器人还是人类。即使在特征数量非常少的情况下,系统仍保持了高性能,证明了无需分析用户资料的所有细节,也能实现有效的机器人检测。

该研究还将他们的新方法与使用不同搜索策略(如遗传算法和粒子群优化)的旧技术进行了比较。虽然那些旧方法能够找到不错的解决方案,但灰狼优化算法被证明更加高效,它找到了更好的特征集,同时将总特征数减少了 63% 以上。这种减少是非常显著的,因为这意味着检测系统可以运行得更快,且需要更少的计算能力,从而使其在大型社交媒体平台上更具实际应用价值。研究人员发现,虽然某些模型在特征过少时会表现挣扎,但其他模型(如决策树和 XGBoost)则在他们提供的高质量、紧凑型数据下表现优异。

最终,这项工作表明,有效的机器人检测并不需要筛选海量的数据。通过仔细选择正确的线索,研究人员可以构建出既快速又准确的系统。研究证实,结合自然启发式搜索方法和统计排名工具,可以成功分离出定义社交媒体机器人的特定行为。尽管研究人员指出,未来的工作需要应对不断演变的机器人创建策略,并可能纳入更复杂的数据类型,但他们目前的发现提供了一条清晰的前行路径。他们已经证明,通过正确的方法,完全可以穿透数字噪声,识别出那些威胁在线社区完整性的自动化账号。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →