Symbolic Log Shield - an adversarial resistant neurosymbolic framework for network log classification
本文介绍了符号日志屏蔽(Symbolic Log Shield),这是一种神经符号框架,它显著减轻了大型语言模型在网络日志分类中面对对抗性越狱攻击的脆弱性,有效地将异常检测性能从严重退化的水平恢复甚至提升至更高水平。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,数字世界是一座巨大且繁忙的城市,每一台计算机、服务器和路由器都是留下足迹的市民。这些足迹被称为“日志”。它们讲述了发生过什么故事:谁进入了大楼,他们碰触了什么,以及他们是否试图撬锁。多年来,安全团队一直使用智能计算机程序来阅读这些日志并识别坏人。最近,我们开始使用一种新型的超智能计算机大脑,即“大语言模型”(LLM)。把 LLM 想象成一位读遍了图书馆所有书籍的侦探;它非常擅长理解足迹背后的故事,并分辨出可疑活动究竟是真实的攻击,还是仅仅是一个笨手笨脚的清洁工。
但问题在于:就像人类侦探会被聪明的骗子欺骗一样,这些 AI 侦探也会被愚弄。“越狱”(Jailbreak)攻击就像是罪犯向侦探低声诉说一个秘密代码或编造一个假故事,让侦探相信犯罪现场其实是一个无害的生日派对。如果侦探被骗了,警报就不会响起,城市就会处于脆弱状态。这篇论文深入探讨了这些 AI 侦探被愚弄的难易程度,更重要的是,它构建了一种新的盾牌来保护它们。
论文:为 AI 侦探构建“日志盾牌”
在这项研究中,研究人员旨在测试这些 AI 日志侦探到底有多脆弱。他们选取了几个不同的 AI 模型——从拥有 20 亿个“脑细胞”(参数)的小巧灵活的模型,到拥有 1280 亿个参数的重量级巨头——并让它们投入到网络日志的分析工作中。他们的第一个任务是看它们能否识别出真实的网络攻击。当日志是干净且诚实的时候,大型模型表现出色,其中最大的模型(Mistral-Medium-3.5-128B)准确率得分(AUROC)约为 84.54%。较小的模型则显得有些困惑,最小的模型(Qwen3.5-2B)得分约为 60.00%。
接着,研究人员扮演了反派的角色。他们使用 7 种不同类型的越狱技巧 制作了一个特殊的“对抗性数据集”。这些不仅仅是随机的拼写错误,而是复杂的心理操纵。有些技巧涉及将日志数据包装在一个虚假的故事中(例如“深度植入/DeepInception”,要求 AI 想象一个科幻场景,其中攻击行为实际上是正常的维护工作)。另一些技巧则涉及将日志文本隐藏在秘密代码中(如凯撒密码或 Base64),或者用 AI 未经充分训练的语言(如斯瓦希里语或祖鲁语)与 AI 对话,以绕过其安全过滤器。
结果如何?AI 侦探完全被骗了。这些攻击具有毁灭性的效果。巨大的 Mistral 模型的准确率从 84.54% 骤降至 48.83%。较小的模型表现更糟,有些甚至跌破了 30%。研究人员发现,仅仅通过增大 AI 的规模并不能让它更安全;即使是那个拥有 1280 亿参数的巨型模型,在面对这些巧妙的诡计时,也和较小的模型一样脆弱。这些攻击成功地让 AI 相信危险的攻击实际上是“确定:正常”或“几乎确定:正常”,从而有效地使安全系统失明。
解决方案:“符号化日志盾牌”
意识到仅靠 AI 是不够的,团队构建了一个他们称之为 符号化日志盾牌(Symbolic Log Shield) 的新框架。想象一下,这是一个在 AI 侦探看到证据之前的两步安全检查站。
第一步:预处理“净化器”(预检)
在日志到达 AI 之前,它会经过一个严格的、基于规则的过滤器。这不是一个智能大脑,而是一个刻板、不屈的机器人,它确切地知道真实的日志应该是怎样的。
- 它剔除不可见字符(如零宽空格),这些是黑客用来隐藏诡计的手段。
- 它修复奇怪的字母替换(例如将“chMod”还原回“chmod”)。
- 它重新组织日志,使其处于正确的时刻顺序,从而撤销任何试图扰乱时间线的尝试。
- 它将秘密代码翻译回纯文本。
这一层充当了一个能流利使用“黑客语”和“正常语”的翻译员,确保日志在到达 AI 时是干净且结构化的。
第二步:后处理“推理器”(现实检查)
在 AI 做出判断后,日志会进入第二层:一个符号化规则引擎。这就像是一位高级主管,使用严格的规则手册(基于 MITRE ATT & CK 框架)来复核侦探的工作。
- 如果 AI 说“这是正常的”,但主管看到该日志被严重篡改或编码过,主管会否决 AI 并说:“等等,这很可疑!”
- 如果 AI 说“这是一个攻击”,但主管看到并没有实际的网络扫描或奇怪的 IP 地址,主管可能会说:“也许你只是太疑神疑鬼了。”
- 它寻找特定的模式,比如在短时间内检查了大量域名(这是黑客探测网络结构的迹象),而 AI 可能会忽略这一点。
结果:盾牌发挥了奇效
当研究人员在应用了这种全新的 符号化日志盾牌 后测试 AI 模型时,结果是惊人的。这个盾牌不仅修补了漏洞,而且几乎完全恢复了 AI 的视力。
- 恢复能力: 被攻击削弱至 48.83% 的巨大 Mistral 模型,在有了盾牌后回升到了 82.10%。这几乎与它处理干净数据时的表现不相上下!
- 小模型的提升: 小模型的进步甚至更大。在受到攻击时表现挣扎的 Qwen3.5-2B 模型,其得分从 40.41% 跳升至 77.59%。Llama-3.2-3B 模型从糟糕的 26.49% 提升到了稳健的 72.86%。
- 超越原始水平: 在某些情况下,盾牌甚至让模型比处理干净数据时表现得更好。例如,Qwen3-14B 模型在使用盾牌时得分为 81.00%,高于其原始得分的 75.41%。
研究人员还测量了模型的“困惑度”。没有盾牌时,AI 模型经常会放弃并回答“中立”(意味着“我不知道”)或进行盲目猜测。有了盾牌,模型变得更加自信和准确,显著降低了它们的“无知感”。
这意味着什么
论文得出结论:虽然大型 AI 模型功能强大,但在面对巧妙且有针对性的诡计时,它们却异常脆弱。仅仅依赖 AI 是有风险的,因为即使是最大的模型也可能被诱骗而忽视真实的攻击。然而,通过将这些 AI 模型包裹在一个“神经符号”框架中——即将 AI 的模式识别能力与僵化的、基于规则的盾牌相结合——系统就会变得稳健。
作者们认为,这种方法是向前迈出的关键一步。它证明了我们不需要等待 AI 变得神奇地免疫于攻击;相反,我们今天就可以在它周围构建一层保护层。符号化日志盾牌 扮演着守护者的角色,清理噪音并检查逻辑,确保 AI 侦探能够看到真相,即使罪犯正试图撒谎。虽然这项研究侧重于特定类型的越狱和日志数据,但它为让我们的数字城市更安全提供了一个充满希望的蓝图,一次记录,守护一座城。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。