← 最新论文
💬 NLP

ExCyTIn-Bench: Evaluating LLM agents on Cyber Threat Investigation

本文介绍了 ExCyTIn-Bench,这是首个通过从 Microsoft Sentinel 日志和调查图中生成 7,542 个问题来评估大语言模型代理在网络安全威胁调查方面表现的基准,结果显示当前顶尖模型的奖励得分仅为 0.606,凸显了未来仍有巨大的提升空间。

原作者: Yiran Wu, Mauricio Velazco, Andrew Zhao, Manuel Raúl Meléndez Luján, Srisuma Movva, Yogesh K Roy, Quang Nguyen, Roberto Rodriguez, Qingyun Wu, Michael Albada, Julia Kiseleva, Anand Mudgerikar

发布于 2026-05-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Yiran Wu, Mauricio Velazco, Andrew Zhao, Manuel Raúl Meléndez Luján, Srisuma Movva, Yogesh K Roy, Quang Nguyen, Roberto Rodriguez, Qingyun Wu, Michael Albada, Julia Kiseleva, Anand Mudgerikar

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用通俗语言和日常类比对论文《ExCyTIn-Bench》的解释。

全局概览:为 AI 侦探设计的一场全新“驾驶考试”

想象你拥有一支非常聪明、崭新的 AI 机器人队伍。你想知道它们是否足以胜任网络安全侦探的工作。它们能否在堆积如山的杂乱数据中找出坏蛋,并准确还原黑客攻击的全过程?

这篇论文的作者表示:“我们不能仅仅向它们提出诸如‘什么是病毒?’这类常识性问题,因为那只能测试它们的记忆力。我们需要看看它们是否真的能完成实际工作。”

因此,他们构建了ExCyTIn-Bench。你可以将其视为针对 AI 代理(Agent)的一场高风险驾驶考试。只不过,AI 驾驶的不是汽车,而是在一个数字犯罪现场穿行;它行驶的不是测试赛道,而是一个模拟公司的计算机网络,其中充满了虚构(但高度逼真)的安全日志。

他们如何构建这场考试(“犯罪现场”)

为了确保考试公平且逼真,研究人员并没有随意编造问题,而是分三步构建了测试:

  1. 犯罪现场(数据):他们搭建了一个名为"Alpine Ski House"的虚构微软 Azure 公司环境。他们模拟了8 种真实世界中实际发生的网络攻击(如勒索软件或电子邮件诈骗)。他们收集了57 张不同的日志表(类似于警方报告、通话记录和监控录像),其中包含数千条记录。
  2. 地图(图谱):当人类侦探进行调查时,他们不会一次性查看所有内容,而是遵循线索:警报 A 指向 用户 B,进而指向 可疑文件 C。研究人员将这些线索链转化为了一张地图(图谱)
    • 节点:地图上的点代表“警报”(警笛声)和“实体”(涉及的人员或计算机)。
    • :连接它们的线条展示了它们之间的关联。
  3. 问题(考题):研究人员没有让人类编写问题,而是利用 AI 观察这张地图,生成了7,542 个问题
    • 示例:“我们检测到来自 IP 地址 X 的可疑登录。根据地图,黑客使用了哪个文件来窃取密码?”
    • AI 代理必须通过沿着地图的连线“行驶”、查询数据库并串联线索来找到答案。

AI 如何参加考试

AI 代理被置于一个MySQL 数据库环境(一个巨大的档案柜)中。它不知道档案柜的布局。它必须:

  1. 索要地图:“你们有哪些表?”
  2. 读取线索:“给我展示这个 IP 地址的日志。”
  3. 串联线索:“好的,该 IP 地址与这个用户有关联。让我检查一下该用户做了什么。”
  4. 提交答案:“黑客使用了文件 ntdsutil.exe。”

如果 AI 答对了,就得一分。如果它陷入困境或问了错误的问题,得分就会降低。如果 AI 找到了一些线索但未得出最终答案,考试甚至会给予部分分数,就像老师因为学生展示了解题过程而给分一样。

他们的发现(结果)

研究人员在多项测试中评估了许多不同的 AI 模型(包括来自 OpenAI、Google 和 Anthropic 等大公司的模型,以及开源模型)。

  • 难度很大:即使是最聪明的 AI 模型也感到吃力。表现最好的模型(Claude-Opus-4.5)仅获得了0.606分(满分 1.0)。这意味着仍有巨大的提升空间。
  • “顿悟”时刻:表现最佳的 AI 模型是那些能够逐步推理的模型。它们不仅仅是猜测,而是探索数据库,意识到第一次猜测是错误的,然后尝试新的路径,这非常像人类侦探的做法。
  • 开源与大厂之争:令人惊讶的是,一些较小的开源模型的表现几乎与那些庞大且昂贵的模型相当,这表明两者之间的差距正在缩小。

为何这很重要

该论文声称这是此类首个基准测试。在此之前,我们主要测试 AI 对网络安全事实的记忆能力。现在,我们有了方法可以测试 AI 是否能够通过筛选证据并推理复杂的事件链条来真正调查犯罪。

简而言之:作者构建了一个逼真的“犯罪现场”和一套“侦探谜题”,以观察 AI 代理是否能学会成为网络安全调查员。结果表明,虽然 AI 正在进步,但在取代人类安全分析师之前,它还有很长的路要走。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →