← 最新论文
💬 NLP

Benchmarking and Exploring the Capabilities of LLMs for Attack Investigations

本文介绍了 AuditBench,这是一个涵盖 Linux 和 Windows 系统上 50 多个安全场景的综合基准数据集,旨在评估并分析五种前沿大语言模型在四项关键事件响应任务中的性能、错误特征及解释能力。

原作者: Aniket Anand, Yiwei Hou, Daniel Fields, Alex Kantchelian, David Tao, Kurt Thomas, Grant Ho

发布于 2026-06-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Aniket Anand, Yiwei Hou, Daniel Fields, Alex Kantchelian, David Tao, Kurt Thomas, Grant Ho

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是这座繁忙巨型城市的安保主管。每天,成千上万的摄像头和传感器(被称为审计日志)都会记录下每一次脚步、每一扇门的开关以及每一台汽车引擎的启动。大多数时候,人们只是在去上班或买菜(良性活动)。但有时,小偷会潜入其中,撬开锁具或偷走保险箱(攻击)。

问题在于,这座城市产生的数据量如此庞大,以至于人类保安无法监视这一切。他们会被虚假警报搞得精疲力竭,并在噪音中错失真正的犯罪。

**大语言模型(LLMs)**应运而生。把它们想象成超级聪明、不知疲倦的侦探实习生,能够在几秒钟内阅读数百万页的日志。但在我们正式聘用他们之前,我们需要知道:他们真的擅长破案吗?还是只会惊慌失措并冤枉无辜的人?

这篇论文介绍了一个名为 AuditBench 的“期末考试”,专门设计用来测试这些 AI 侦探调查安全日志的能力。

考试内容:AuditBench

研究人员构建了一个包含 51 个不同场景的测试套件。

  • “教室”(实验室数据): 他们在虚拟计算机上创建了 25 个模拟场景,涵盖了从黑客窃取文件到普通用户仅仅是安装软件的所有情况。
  • “真实世界”(OpTC 数据): 他们从一个庞大的真实世界数据集(DAR件 DARPA OpTC)中提取了 26 个复杂的场景,这些场景已经拥有已知的“地面真值”(即标准答案)。

这场考试包含四个主要任务,就像侦探的检查清单一样:

  1. 分类分诊(分类): “这个警报是真实的犯罪,还是虚假警报?”
  2. 藏身之处(持久化): “罪犯是否设置了一个秘密后门,以便永久留在系统中?”
  3. 逃生路线(横向移动): “罪犯是否从一台计算机跳转到另一台计算机,以扩散感染?”
  4. 劫掠(数据外泄): “罪犯是否偷走了敏感文件并将其发送出去?”

结果:AI 做对了什么(以及做错了什么)

研究人员使用这个考试测试了五种顶尖的 AI 模型(包括像 GPT-5 和 Gemini 2.5 Pro 这样的巨头)。以下是研究结果,已转化为日常用语:

1. “偏执侦探”问题
大多数 AI 侦探都过度怀疑。它们就像是一个看到有人提着包就立刻认定那是炸弹的保安。

  • 结果: AI 在发现“劫掠”(窃取数据)方面表现出色,但在忽略无辜者方面表现糟糕。它们会将大量的正常活动标记为“攻击”,从而制造出大量的虚假警报。

2. 规模并不总是代表更好
你可能会认为,规模最大、最昂贵的 AI 模型会是最好的侦探。令人惊讶的是,事实并不总是如此

  • 结果: 有时,规模较小、更便宜的模型表现得和庞大的模型一样好,甚至更好。事实证明,对于这项特定的工作,你并不总是需要一台超级计算机;一个聪明且紧凑的模型就能胜任。

3. 日志的语言很重要
研究人员以两种方式将日志喂给 AI:

  • 原始日志: 记录发生的一切的杂乱、未经编辑的转录文本(就像是一段混乱房间里的原始音频录制)。
  • 边表示法(Edge Representation): 一个经过清理、汇总的版本,强调了事件之间的联系(就像是侦探用线连接嫌疑人的白板)。
  • 结果: 对于某些模型,“清理过”的版本让它们变得更聪明、更快速。而对于其他模型,原始数据则完全没问题。这取决于模型的“学习风格”。

4. “提示词”就是说明书
你提问的方式会改变答案。研究人员尝试了两种不同的编写指令(提示词)的方法。

  • 结果: 让一个 AI 侦探变得卓越的提示词,可能会让另一个 AI 变得笨拙。并没有“一劳永逸”的说明书。你必须针对你正在使用的特定 AI 进行指令微调。

5. AI 的“推理”通常很出色
当 AI 正确 识别出一次真实攻击时,它的解释通常非常优秀。它能够指出证明犯罪行为的精确文件或命令。

  • 症结所在: 当它出错时(即虚假警报),其推理往往基于奇怪的名字高频率
    • 例子: 如果一个文件的名字是 delete_logs.bat,AI 就会认为这是罪犯试图掩盖证据,即使它只是一个正常的系统清理脚本。
    • 例子: 如果一个程序在一秒钟内运行了 1,000 次,AI 会想:“这很可疑!”即便这只是一个正常的软件更新。

核心启示

这篇论文并不是说“AI 已经可以取代安全团队了”。相反,它是在说:“这里有一把衡量 AI 从事这项工作的能力的尺子,以及需要避开的陷阱。”

  • 对于安全团队: 不要只购买最昂贵的 AI。测试更小的模型。警惕那些制造虚假警报的“偏执”倾向。
  • 对于 AI 开发人员: 不要假设更大的模型总是更好的。你可能需要改变喂给它们数据的方式(“边”表示法),或者调整你的指令(提示词)来获得最佳结果。
  • 对于所有人: AI 是一个强大的工具,但它需要人类来复核它的工作,尤其是在它对无辜者过于怀疑的时候。

研究人员正在向公众发布他们所有的数据、代码和考试题目,以便他人能够持续测试并改进这些数字侦探。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →