LLMs for Zero-Shot Threat Detection via Structured Risk Indicators
本文提出了一种两阶段大语言模型(LLM)框架,该框架利用检索增强生成技术从用户活动时间线中创建结构化且具可解释性的风险指标,通过证明这些指标的质量是性能的主要驱动因素,实现了对内部威胁和高级持续性威胁(APT)的最先进零样本检测。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代组织的数字堡垒中,安全系统时刻监视着入侵者。其中一些系统会扫描计算机之间流动的流量,寻找数据流中的可疑模式。另一些系统则直接部署在计算机本身,监控内部发生的情况:谁登录了系统、打开了哪些文件、插上了哪些设备以及发送了哪些电子邮件。这种内部监控至关重要,因为最危险的威胁往往来自内部。当攻击者窃取合法的密码或说服员工做出违背公司利益的行为时,他们在系统中移动时看起来与普通用户完全一致。为了捕捉他们,安全团队必须能够区分一个人是在加班完成项目,还是在悄悄窃取敏感数据,这项任务需要理解一个人行为的完整故事,而不仅仅是某个瞬间。
昆士兰大学的一个研究小组开发了一种新方法,旨在帮助计算机进行这种区分,而无需针对特定的恶意行为进行长年的训练。他们并没有要求计算机去观察一堆杂乱的原始安全日志并立即大喊“威胁”或“安全”,而是构建了一个更像严谨分析师的两步系统。首先,该系统将用户的活动组织成一条时间线,并要求一个强大的语言模型将这条时间线转化为一份清晰、结构化的风险因素列表。它要求模型识别可能存在问题的具体事项,例如在异常时间访问文件或连接到奇怪的服务器。然后,第二个模型会观察这些风险列表随时间变化的序列,以发现暗示攻击正在展开的模式。这种方法使系统既能检测出内部威胁(即受信任的员工转变为恶意行为者),也能检测出高级持续性威胁(即复杂的外部攻击者长期潜伏在网络中)。
研究人员在两组不同的安全数据上测试了这种方法。一组数据集模拟了一个涉及近百名员工、持续十八个月的内部威胁场景,记录了从电子邮件交换到文件传输的一切内容。另一组数据集则模拟了针对网络的隐蔽外部攻击,追踪了数千次计算机之间的连接。在两种情况下,新系统的表现都显著优于以往依赖语言模型的方法。在内部威胁数据上,新方法在提高正确识别攻击能力的同时,将误报率降低了超过十一个百分点。在网络攻击数据上,提升更为显著,跃升了超过三十一个百分点。成功的关键不仅在于使用更大的“计算机大脑”,还在于改变信息处理的方式。通过强制第一个模型在做出最终判断之前,将复杂的日志分解为简单、可解释的风险指标,该系统变得能够更好地识别正常工作与恶意活动之间的细微差别。
最有趣的发现之一是该系统如何处理对上下文的需求。研究人员发现,对于规模较小、功能较弱的语言模型,提供用户过去行为的摘要有助于它们生成更好的风险指标。这就像是模型需要看到用户的历史记录,才能理解当前时刻的异常之处。然而,对于更大、更强大的模型来说,提供这些额外的历史背景几乎没有区别;它们已经能够独立生成高质量的风险指标。这表明,初始风险评估的质量是捕捉这些威胁的最重要因素。如果过程的第一步能产生清晰且准确的危险图像,第二步就能轻松识别攻击模式。如果第一步模糊或混乱,无论最终分类器的能力有多强,系统都会难以应对。
研究还揭示了数据分组方式的重要性。当系统将一个人的所有活动视为一个连续的故事,而不是孤立地看待单个事件或机器之间的连接时,效果最好。当研究人员尝试按两台计算机之间的连接而非按使用这些计算机的人进行数据分组时,系统的性能显著下降。这是因为攻击者的行为定义在跨越多种不同工具和日志的行为之上,只有通过观察全貌,系统才能看到威胁的完整范围。研究人员指出,虽然该系统在处理第一组数据集中的内部威胁方面表现出色,但第二组数据集涉及非常隐蔽的网络攻击,呈现出一个更具挑战性的局面,其中的信号要微弱得多。即便如此,这种结构化的方法仍然提供了一个坚实的检测基础,证明了将复杂的安全数据分解为易于管理、可解释的部分是一种强大的策略。
最终,这项工作表明,自动化威胁检测的未来可能不在于训练计算机去记忆每一种可能的攻击,而在于教它们以结构化的方式对行为进行推理。通过使用语言模型将原始数据转化为清晰的风险指标,并随后分析这些指标随时间的变化,安全系统可以变得更加准确和可靠。研究结果表明,最有效的设置取决于所针对的特定威胁类型以及所使用的模型的性能,但核心原则保持不变:中间步骤的清晰度会导致最终决策的更好结果。这种方法为保护组织免受内部人员背叛以及外部人员潜伏攻击提供了充满前景的路径。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。