DiagChain: A Diagnostic Benchmark for Evaluating LLM Agents on Evidence-Grounded Attack Chain Reconstruction
该论文介绍了 DiagChain,这是一个包含 69 种多样化场景的诊断基准,以及用于评估大语言模型智能体在基于证据的攻击链重构能力的 ECRAG 框架,并揭示了虽然较大的模型在证据排序方面存在困难,但较小的模型则无法进行基础的证据整合,从而强调了进行阶段性评估而非仅评估综合准确性的必要性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一名正在试图破解谜题的侦探,但你的现场不是犯罪现场,而是一个数字犯罪现场。这些“线索”散落在各处:数以百万计的计算机日志、安全警报和系统记录。在网络安全领域,专家们使用大语言模型(LLM)——即经过海量文本训练的超智能 AI 聊天机器人——来充当数字侦探。这些 AI 代理被期望能够阅读这些杂乱的线索,理清发生了什么,并按正确的顺序写下攻击过程的故事。这个过程被称为攻击链重构(attack chain reconstruction)。这就像是试图观看一部被剪碎成数千个随机帧的电影,然后要求某人将这些帧重新按顺序排列,从而讲述完整的故事。
但问题在于:大多数针对这些 AI 侦探的测试只关注它们写出的最终故事。如果故事错了,测试会判定为“失败”,但它不会告诉你为什么。是侦探漏掉了某个线索?还是他们找到了线索却忘了写下来?或者是他们找到了正确的线索,但把顺序放错了?我们需要一种方法,在侦探工作时窥视他们的“大脑”,看看他们究竟在哪里卡住了。这就是新论文 DiagChain 的意义所在。它引入了一个特殊的测试场,其设计目的不仅是为了给最终答案评分,更是为了诊断 AI 侦探在哪个具体步骤中丢失了线索。
该论文的作者——来自清华大学和中车集团的研究人员——构建了一个名为 DiagChain 的新基准测试来解决这个盲点。他们创建了一个名为 MAIN-69 的数据集,其中包含 69 个不同的“犯罪现场”(场景),涵盖了从简单到极其复杂的各种情况。这些场景源自真实的 Linux 日志、Windows 事件和云端警报等现实世界数据。为了使测试更具真实感,他们加入了不同程度的“噪声”——比如在线索中加入无害的背景杂音,以观察 AI 是否会被分散注意力。他们还改变了攻击链的长度,从短促的活动爆发到漫长的渗透过程。
为了测试 AI,他们使用了一种称为 ECRAG(以证据为中心的检索增强生成)的特殊工作流。把这想象成给了 AI 侦探一个放大镜和一个会自动更新的笔记本。AI 必须搜索线索、将它们分组、确定时间线,然后编写故事,同时不断检查自己的工作。研究人员通过五个特定的“健康检查”而非仅仅一个最终成绩来衡量 AI 的表现:
- 检索(Retrieval): AI 是否找到了线索?
- 分组(Grouping): 它是否将相关的线索放入了正确的“桶”中?
- 排序(Ordering): 它是否按正确的时间顺序排列了事件?
- 落地/溯源(Grounding): 它是否确实利用找到的线索来支持其故事?
- 归因差距(Attribution Gap): 它是否找到了一个线索,看了它,然后在最终报告中却忘了提及它?
结果令人警醒。即使是最智能的 AI 配置,在处理 MAIN-69 数据集中的 849 个参考步骤时,也只能做到在不犯前序错误的情况下完全正确,准确率仅为 39.6%。论文指出,AI 模型的类型对于它们在哪里出错有着很大影响。较小的模型通常在基础环节挣扎:它们能找到线索,但无法将其纳入最终的故事中,本质上是丢弃了证据。而更大、更强大的模型虽然擅长寻找和保留线索,但往往在尝试按正确顺序排列它们时出错。这就像一个小侦探找到了枪,却忘了把它写下来;而一个大侦探找到了枪、指纹和地图,却把抢劫的时间线完全搞混了。
研究人员还测试了如果给予 AI 更多时间或更多的“搜索预算”(允许它查看更多线索)会发生什么。他们发现,仅仅给 AI 更多资源并不能自动解决问题。虽然查看更多线索有助于 AI 发现更多证据,但这并不保证 AI 能正确组织这些证据,也不保证它在最终组装过程中不再出错。事实上,对于某些模型来说,在没有更好策略的情况下查看过多线索反而会让任务变得更难。
最终,该论文认为我们应该停止仅仅盯着最终得分,而应开始诊断整个过程。研究结果表明,单纯扩大 AI 模型规模并不能解决“链条组装”的问题,它只是将瓶颈从“寻找线索”转移到了“组织线索”。为了构建真正可靠的网络安全代理,我们需要设计专门擅长将所获证据编织成连贯、有序且有据可查的故事的系统,而不是仅仅寄希望于更大的模型能自行解决问题。作者提供了他们的代码和数据,以便他人继续测试和改进这些数字侦探。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。