Hierarchical Agentic Incident Response with Digital-Twin-Validated Attack Inference
本文提出了一种分层智能体框架,该框架集成了用于攻击推理的微调大语言模型、用于校准的数字孪生验证以及用于自动化多阶段事件响应的展开规划,在企业网络测试台上实现了比前沿大语言模型基线显著更高的恢复成功率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
当网络遭到入侵时,一场与无声、隐形的敌人之间的计时赛便开始了。防御者面临着一个混乱的谜题:他们能看到零散的警报和异常的数据峰值,却无法看清入侵者移动的全貌、触碰了哪些部分,或者下一步可能袭击哪里。在这样的迷雾中做出正确的决策需要两件极其困难的事情:首先,要从不完整的线索中正确推测出攻击者的路径;其次,要选择一套修复序列,既能阻止破坏,又不会引发新的问题。几十年来,安全团队一直依赖人类专家来拼凑这些信息,这是一个缓慢且令人精疲力竭的过程,当攻击变得复杂或团队规模较小时,这种方式往往会失效。自主防御领域试图用能够独立思考、规划和行动的智能系统来取代这种人力劳动,但构建一个能够在不犯危险错误的情况下对网络攻击进行推理的机器,仍然是一个棘手的挑战。
香港城市大学和福特汉姆大学的研究人员通过将三种不同的工具结合成一个单一的分层系统,为这一问题提供了一种全新的方法。他们构建了一个框架,在这个框架中,人工智能不仅仅是在猜测答案,而是在行动之前先测试自己的猜测。该系统始于一个专门的语言模型,它扮演着侦探的角色,通过阅读安全日志和系统数据来重建可能的攻击序列。系统并不会立即接受这种重建结果,而是将怀疑的攻击序列在“数字孪生”(digital twin)——一个能完美模拟真实网络行为的虚拟副本——中运行。如果虚拟攻击产生的效果与真实的警报一致,系统就知道其猜测是正确的。如果虚拟结果有所不同,系统会将这种差异反馈给侦探模型,以修正其叙述。这种“猜测、测试、纠正”的循环确保了计划是建立在对现实的扎实理解之上,而非幻觉之上。
一旦系统对发生的情况有了把握,就会进入规划阶段,该阶段分为两个决策层面。第一层是战术层,它观察整个网络,以决定优先修复哪些损坏的部分。它使用一种模拟多种可能未来的方法,寻找能使总停机时间最小化的修复顺序。第二层是操作层,它接收战术规划器选定的特定组件,并确定具体如何修复它。在这里,另一个人工智能代理会提出高层级的恢复步骤,例如隔离服务器或重置密码。在这些步骤应用于真实网络之前,第三个代理会将它们转化为具体的计算机命令,并在数字孪生中再次运行。这种最终检查验证了这些命令是否真的有效,以及是否会意外导致系统崩溃。只有在通过了这种严格的模拟后,系统才会对实际网络执行恢复。
研究人员在一个包含三十三个互连组件的现实容器化网络测试床上测试了该框架,模拟了三种从简单到高度复杂的不同类型的多阶段攻击。他们将该系统与依赖标准提示(prompting)而缺乏这种分层验证的其他先进人工智能模型进行了对比。结果显示,新方法具有明显优势。在最简单的攻击场景中,该框架成功实现网络完全恢复的概率为 90%,而表现最好的竞争模型仅为 72%。随着攻击变得更加复杂,差距进一步扩大,新系统的成功率保持在 86% 到 88% 之间,而其他模型则在 60% 到 67% 之间。这代表了 18 到 31 个百分点的恢复成功率提升。此外,该系统效率更高,通常每个组件仅执行六个简洁的高层级动作,而竞争模型往往生成七到十五个动作,导致执行时间更长且更具变动性。
这项研究表明,将人工智能植根于模拟现实中,可以显著降低高风险环境中的错误风险。通过强制系统在接触真实世界之前,先在安全的虚拟空间内重演其理论并验证其命令,研究人员创建了一个纯语言模型所缺乏的问责闭环。这项工作并不声称已经解决了网络防御中的所有问题,但它为提高自动化响应的可靠性提供了一种具体的方法。研究结果表明,自主安全的未来可能不在于让人工智能在孤立状态下变得更聪明,而在于给它一个练习招式的“沙盒”,从而确保当它最终行动时,能够精准且自信地执行。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。