← 最新论文
⚡ electrical engineering

SiNMULI: Novel Signed Network Approach for Malicious URL Identification

该论文提出了 SiNMULI,一种基于符号网络的创新框架,该框架利用社会平衡理论和反向链接分析来识别恶意 URL,准确率达 99.89%,为传统的机器学习模型提供了一种轻量级、可解释且不依赖训练数据的替代方案。

原作者: Avijit Gayen, Sayan Mondal, Angshuman Jana

发布于 2026-08-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Avijit Gayen, Sayan Mondal, Angshuman Jana

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

互联网是一个庞大且互联的信息网络,但它也是一个危险潜伏在明处的地方。每天,人们都会点击一些旨在窃取密码、传播欺诈或安装有害软件的链接。几十年来,安全专家一直试图通过建立已知恶意地址的列表,或教计算机识别网址文本中的可疑模式来阻止这些威胁。这些方法对于已知威胁效果良好,但当攻击者创建出看起来与真实网站完全一致的巧妙伪装站点时,往往会失效。为了解决这个问题,研究人员开始不再仅仅将互联网视为单个页面的集合,而是将其视为一个巨大的社交网络,其中每个网站都与其他网站存在着某种关系。就像社区中的人会信任某些邻居并怀疑另一些人一样,网站也会链接到某些站点并避开另一些站点。通过研究这些连接,就有可能洞察网络的隐藏结构,并识别出那些格格不入的恶意行为者。

来自印度信息技术学院(位于古瓦哈提)的一个研究小组开发了一种利用这一理念来捕捉恶意网站的新方法。他们将这种方法称为 SiNMULI,该系统将互联网视为一个有符号的网络(signed network)。在这个系统中,每个网站都是一个点,而它们之间的每个链接都是一条带有特定含义的线。如果一个受信任的安全网站链接到另一个站点,该连接会被标记为“正向”,就像投下了一票信任;如果一个已知的恶意网站链接到另一个站点,该连接会被标记为“负向”,预示着危险。研究人员意识到,大多数现有的安全工具忽略了这些关系,而是专注于单个页面的内容。相比之下,SiNMULI 观察全局,利用社会平衡(social balance)的逻辑来判断哪些网站是安全的,哪些是不安全的。其核心思想非常简单:在一个稳定的网络中,朋友倾向于链接到其他朋友,而敌人则倾向于链接到其他敌人。如果一个网站被已知安全网站的链接所环绕,它很可能是安全的;如果它被已知恶意网站的链接所环绕,它很可能是危险的。

为了测试这个想法,研究人员从大量已知的安全网站和已知危险网站开始。他们利用这些作为起点来探索更广泛的网络,通过追踪链接来发现新的未知网站。在抓取互联网的过程中,他们构建了一个庞大的连接图谱,记录了哪些站点链接到了哪些站点。随后,他们将一套基于社会平衡理论的规则应用于这张图谱。这些规则允许系统推断未知链接的性质。例如,如果一个已知安全站点链接到一个未知站点,而该未知站点又链接到另一个已知安全站点,系统就可以推断该未知站点很可能是安全的。反之,如果一个未知站点被已知恶意网站链接,系统就会将其标记为危险。研究人员不需要用成千上万个例子来训练复杂的计算机模型;相反,他们依靠互联网自身的自然结构来揭示真相。

该方法的测试结果令人瞩目。在真实世界的数据测试中,该系统的恶意网站识别准确率达到了 99.89%。它能够识别出几乎所有的坏网站,同时极少误判安全网站。这种性能始终能匹配或超过依赖机器学习或深度神经网络的传统方法,而后者在面对新的或伪装的威胁时往往难以应对。最重要的发现之一是,该系统在无需大量训练数据的情况下即可运行。因为它依赖于网站之间现有的链接结构,所以即使面对从未见过的威胁,它也能立即识别出来。然而,研究人员指出,目前的流程是离线运行的;构建完整的有符号网络并运行迭代式的基于平衡的标签传播(label propagation)需要高昂的计算成本,这使得实时部署面临挑战,除非进行进一步的工程改进。这使得该系统在训练需求方面表现轻量化,但其分析过程本身需要大量的时间和计算能力。

研究人员还发现,恶意网站在网络中的行为方式与安全网站不同。安全网站往往连接紧密,形成大型且紧密的集群,链接到许多其他受信任的站点。而恶意网站则通常位于网络的边缘。它们的连接较少,且链接往往是稀疏或孤立的。这种结构上的差异提供了另一层证据,帮助系统做出准确决策。研究表明,通过观察网站如何相互连接,安全专家可以观察到那些在孤立观察单个页面时无法看到的模式。该系统还具有透明度;不同于一些决策过程隐藏在“黑盒”之中的现代安全工具,这种方法允许分析师清楚地看到为什么某个站点被标记。他们可以追踪导致结论的链接链,从而更容易理解并信任结果。

尽管该方法被证明非常有效,但研究人员也承认它并非完美。数据收集过程十分困难,因为许多恶意网站寿命极短,在被完整映射之前就已消失,或者它们会使用技巧来阻挡自动化扫描器。这意味着网络图谱有时是不完整的,一些坏网站仍能隐匿其中。此外,目前的系统在能够分析完整网络结构时效果最好,而这需要耗费大量时间和计算能力。对于需要在瞬间做出决策的实时防护场景,该系统需要进行调整以提高速度。尽管存在这些挑战,这项研究仍提供了一个强大的新视角。它表明,对抗数字威胁的最佳方式不仅是更深入地检查单个代码片段,而是要理解将互联网连接在一起的关系。通过将 Web 视为一个信任与不信任在站点间传递的社交网络,研究人员找到了一种观察能够揭示真相的隐形模式的方法。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →