Detection of the Malicious URL Using the Language Models
本文提出利用语言模型(特别是 BERT)来捕捉恶意 URL 中短语的语义含义,从而在多分类准确率上实现了显著提升,达到 99.7%,相比之下,传统方法仅依赖于词法和统计特征。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
互联网已成为现代生活的神经中枢,这是一个庞大的网络,组织通过网址提供服务,人们通过网址分享信息。这些地址被称为 URL(统一资源定位符),是解锁网页特定页面的钥匙。然而,正如实物钥匙可能被伪造以开启不该打开的门一样,数字链接也可以被精心设计以进行欺骗。恶意 URL 就是这些伪造的钥匙;它们是旨在诱导用户访问旨在窃取资金、搜集隐私信息或在设备上安装有害软件的网站的链接。虽然有些威胁显而易见,但许多威胁却十分隐蔽,对于普通人来说,区分安全链接与危险链接往往非常困难。为了抵御这些数字陷阱,安全专家长期以来一直依赖已知坏链接的列表,但这些列表只能拦截它们已经见过的威胁。当出现新的、未见的威胁时,旧的列表就会失效。这种局限性促使研究人员寻找更聪明的方法来识别危险,即超越简单的清单,转向能够真正理解网址背后含义的系统。
在最近的一项研究中,来自库姆大学和伊斯兰阿扎德大学的研究人员应对了这一挑战,他们通过教计算机去阅读网址内单词的含义,而不是仅仅计算它们的字符数量。多年来,自动化系统一直试图通过观察形状和结构来识别恶意链接——测量地址的长度、统计符号的数量,或检查其是否包含可疑的字母字符串。这些方法在许多情况下效果良好,但它们忽略了语言的细微差别。一个恶意的链接可能会使用看起来无害的单词,并以一种暗示诈骗的方式进行排列,就像一封使用礼貌语言索要密码的钓鱼邮件一样。研究人员意识到,要捕捉这些复杂的诡计,系统需要理解单词之间的语义关系,或者它们如何组合在一起形成特定的含义。为此,他们求助于语言模型,这是一种经过海量文本训练的高级计算机程序,旨在理解人类语言中单词之间的相互关系。
团队测试了四种不同类型的语言模型,以观察哪一种能最好地识别 URL 的意图。前两种——Word2vec 和 GloVe——是根据单词在文本中出现的频率将其映射到数学空间的系统。它们擅长理解“国王”和“女王”这类词语之间的关联,但它们将每个单词视为孤立个体,而不考虑句子的完整上下文。第三种模型 LASER 旨在同时处理多种语言,将句子映射到一个共享空间中,尽管它侧重于整个句子而非单个单词的细节。最后的模型 BERT 是一个更近期且功能更强大的工具,它会观察一个单词在前后所有单词语境下的情况。这使得它能够捕捉到取决于句子特定排列方式的微妙意义差异。研究人员将这些模型应用于一个包含超过 114,000 个网址的数据集,其中包括安全链接以及旨在进行垃圾邮件、钓鱼攻击、恶意软件攻击和网站篡改的链接。
为了让这些网址能够被语言模型读取,研究人员首先必须将它们分解成更小的部分,这个过程称为“分词”(tokenization)。对于前三种模型,他们手动剥离了斜杠和问号等符号,将剩余的单词作为核心数据。对于 BERT 模型,他们使用了一种专门的工具,自动将地址分解为子词和符号,并将标点符号保留在内,因为 BERT 的设计初衷就是理解这些符号如何改变上下文。一旦地址处理完毕,模型会为每个网址生成一个独特的数值表示,捕捉其语义本质。这些表示随后被输入到一个受人类大脑启发的神经网络中,这种类型的计算机程序通过学习识别模式,并为每个 URL 分配一个标签,例如“安全”、“垃圾邮件”或“钓鱼”。
实验结果显示了一个明显的赢家。虽然所有的语言模型表现都优于许多仅依赖统计特征的以往方法,但 BERT 模型脱颖而出。它达到了 99.71% 的准确率,在几乎所有情况下都能正确识别网址的性质。其他模型也表现出色,Gloove 模型的准确率达到 98.94%,Word2vec 达到 98.62%,但它们都逊色于 BERT 的精准度。研究人员指出,即使是本研究中表现最低的模型 LASER,其 97.46% 的准确率仍然超越了该领域许多现有的技术。这表明,仅仅将关注点从 URL 的物理结构转向其单词的含义,就能带来实质性的安全性提升。该研究证明,通过使用能够理解单词上下文和关系的模型,计算机在识别指示恶意链接的微妙语言线索方面会变得更加有效。
研究人员得出结论,他们的方法为计算机安全中的一个持久问题提供了稳健的解决方案。通过对网址中发现的单词进行语义空间建模,他们能够以传统方法无法实现的方式捕捉链接背后的意图。特别是 BERT 模型的成功,突显了使用深度、上下文感知型语言理解来检测威胁的价值。这并不意味着旧方法毫无用处,而是将它们与理解 URL“含义”的能力相结合,可以创造出更强大的防御体系。随着网络罪犯不断演变其策略,使他们的恶意链接看起来越来越像合法的链接,理解他们所使用单词之上下文的能力将成为保障互联网安全的重要工具。这项研究提供了一条清晰的前行路径,表明 URL 检测的未来在于教机器“读懂言外之意”。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。