← 最新论文
💻 computer science

Prediction of SQL injection using Machine Learning

本文专注于评估各种机器学习技术,以有效地检测和预测 SQL 注入攻击,这类攻击允许攻击者操纵数据库查询并破坏服务器安全性。

原作者: Radhika Sreedharan, Sampath A K

发布于 2026-07-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Radhika Sreedharan, Sampath A K

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

数字保安与假身份的艺术

想象一下,互联网是一座巨大且繁忙的城市,每一座网站都是一栋带有前台的建筑。在前台后面坐着一个巨大的、组织严密的图书馆,也就是数据库,里面存放着从你最喜欢的猫咪视频到你的银行账号等一切信息。要向图书管理员请求一本书,你需要使用一种特殊的语言,叫做 SQL(结构化查询语言)。这就像是一种礼貌且标准化的表达方式,比如:“请把所有名字为‘Alice’的记录展示给我。”

但如果前台的那个人不是一位礼貌的访客,而是一位伪装大师呢?这就是 SQL 注入的世界。这是一个狡猾的诡计,攻击者不仅仅是请求一本书,他们还在请求中夹带了一张假便条,以此欺骗图书管理员,让管理员误以为:“噢,实际上,请把这栋建筑里的每一本书都展示给我,”甚至,“让我来重写目录吧。”如果建筑物的安保薄弱,这个诡计会让黑客窃取秘密、删除记录,甚至彻底锁上大门。

为了阻止这些数字窃贼,科学家们正转向使用 机器学习深度学习。不要把它们看作魔法咒语,而要把它们看作非常聪明、不知疲倦的保安。这些保安并不只是死记硬背一份已知坏人的名单,而是研究成千上万起过去的事件。他们学习“正常”请求与“诡计”请求之间的微妙模式,就像经验丰富的保安仅凭一个人拿假身份证的方式就能识破伪装一样。核心问题在于:我们能否教会这些数字保安,让他们能够足够快速且准确地识别出那些伪装者,从而保护图书馆的安全?


伟大的数据库劫案:智能保安的故事

在这项研究中,来自普雷西迪大学(Presidency University)的 Radhika Sreedharan 和 Dr. Sampath A K 决定对几种不同类型的数字保安进行测试。他们的目标简单而至关重要:寻找最佳的机器学习算法,以便在 SQL 注入攻击造成破坏之前将其识别出来。他们将这个问题视作一场“找出冒充者”的游戏,使用了一个包含数千个数据库查询的数据集——其中一些是诚实的、正常的请求(标记为 0),另一些则是恶意的、注入的攻击(标记为 1)。

研究人员并没有只挑选一位保安,而是带来了一整支风格各异的队伍。其中包括像 支持向量机 (SVM)决策树 (Decision Trees)随机森林 (Random Forests) 这样的经典侦探,它们寻找特定的规则和模式。然后还有像 LSTM(一种深度学习模型)这样的深思者,它们试图理解单词的序列和流动,就像通过阅读句子来理解其含义,而不仅仅是统计字母的数量。他们还尝试了 逻辑回归 (Logistic Regression)凝聚聚类 (Agglomerative Clustering),后者通过将相似的事物分组在一起,从而发现其中的异类。

但这里是他们故事中的转折点:这些保安的训练有点像教狗去捡球。研究人员发现,如果你只给保安看“好狗”(正常查询)或者只看“坏狗”(攻击),保安就会感到困惑。如果一个保安只见过正常查询,它就会认为所有东西都是安全的,即使黑客走进来也是如此。如果它只见过攻击,它就会开始认为每个访客都是罪犯。论文明确排除了这些模型在孤立状态下运作良好的观点;它们必须在好坏混合的样本上进行训练,才能学会区分差异。

随着训练的进行,结果开始闪耀光芒。作为深度学习专家的 LSTM 模型证明了自己极其敏锐。然而,只有在喂给它混合了正常和恶意查询的数据后,经过几轮训练,它的准确率才达到了 1(或 100%)。如果它只在其中一种类型上进行训练,它就会产生误判。同样,支持向量机 (SVM) 的表现也非常出色,但只有在研究人员增加了包含更多两种标签值(0 和 1)的条目后,它的准确率才超过了 99%随机森林模型也紧随其后,达到了 99% 的准确率,而决策树逻辑回归分别得分 97.8%98.5%。甚至连这种通过分组来处理问题的聚类方法,在拥有足够的混合数据进行处理后,也达到了 97% 的准确率。

然而,论文也强调了一些小问题。当模型仅用一种类型的数据进行测试时(全为好或全为坏),它们表现得非常吃力。例如,凝聚聚类模型并未完全失败,但计算出的准确率很低:在仅针对攻击进行训练时,它仅给出 25% 的准确率;而在仅针对正常查询进行训练时,则为 50%。它需要完整的图景才能理解混乱中的秩序。同样,如果决策树随机森林模型在训练期间没有见过足够的攻击案例,它们就会将攻击误认为是正常查询。

研究人员并不仅仅停留在数字层面;他们还研究了模型为何有效。他们发现,清理数据——即移除那些并非真正属于攻击的奇怪标点错误——是至关重要的第一步。他们还注意到,虽然像 LSTM 这样的模型可以很快达到完美分数,但其他模型则需要更大规模的数据量才能达到。该研究表明,虽然没有哪种单一模型是适用于所有情况的“银弹”,但通过结合使用这些工具,并在多样化且平衡的数据上进行训练,可以建立起非常强大的防御。

最后,论文得出结论,SVMLSTM 是捕捉这些数字窃贼的最强竞争者,紧随其后的是随机森林。作者建议,虽然这些模型非常有效,但工作尚未完成。他们计划深入研究不同类型的攻击并进一步完善他们的模型。目前,结论很明确:要建立一个安全的数字图书馆,你需要一位见过好人和坏人的保安,以及能够分辨两者的正确工具。数据库安全的未来,似乎就蕴含在这些永不停歇地注视着门口的智能学习算法之中。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →