← 最新论文
💻 computer science

From IOCs to Regex: Automating CTI Operationalization for SOC with LLMs

本文提出了名为 IOCRegex-gen 的自动化系统,利用大语言模型结合分组感知机制与多阶段验证流程,将威胁情报中的指标(IOCs)高效转化为高精度的正则表达式,从而显著提升了安全运营中心处理海量威胁情报的自动化水平。

原作者: Pei-Yu Tseng, Lan Zhang, ZihDwo Yeh, Xiaoyan Sun, Xushu Dai, Peng Liu

发布于 2026-04-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Pei-Yu Tseng, Lan Zhang, ZihDwo Yeh, Xiaoyan Sun, Xushu Dai, Peng Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇文章介绍了一个名为 IOCRegex-gen 的新系统,它的核心任务是把“威胁情报”自动翻译成“搜索密码”,帮助网络安全专家更快地发现黑客。

为了让你更容易理解,我们可以把整个网络安全世界想象成一个巨大的图书馆,而黑客就是试图混入图书馆的捣乱者

1. 背景:图书馆里的“通缉令”与“搜索咒语”

  • CTI 报告(通缉令):
    网络安全公司每天会发布很多报告(CTI),就像图书馆管理员收到的“通缉令”。上面写着:“注意!有个坏蛋可能会在书架上涂胶水(文件路径),或者在登记簿上乱写名字(注册表键值)。”

    • 问题: 这些报告是用自然语言写的,比如“坏蛋可能会在 C:\Users\Public 文件夹里放一个 .bat 文件”。
  • 日志(图书馆的监控录像):
    图书馆里每分每秒都在产生海量的监控记录(系统日志),记录着谁进了门、碰了什么书。

  • 正则表达式(搜索咒语):
    为了在海量监控录像里找到那个坏蛋,管理员不能只搜“完全一样的字”,因为坏蛋很狡猾,可能会把文件名从 11.bat 改成 12.bat,或者把路径大小写变一下。
    这时候就需要正则表达式(Regex)。它就像是一个超级灵活的搜索咒语

    • 普通搜索:11.bat(只能找到这一个)。
    • 正则搜索:.*\.bat(能抓到所有以 .bat 结尾的文件,不管前面叫什么)。

2. 痛点:以前全靠“人工翻译”,太慢了!

过去,当收到一份新的“通缉令”(CTI 报告)时,安全分析师(图书馆管理员)必须手动做两件事:

  1. 提取线索: 从报告里把坏蛋可能用的文件名、路径找出来。
  2. 编写咒语: 把找到的线索(比如 C:\Users\Public\11.bat)手动改写成灵活的“搜索咒语”(正则表达式)。

这就像让一个翻译官,把一本厚厚的小说,逐字逐句地翻译成一种只有机器能懂的“密码语言”。

  • 太慢: 报告越来越多,人手不够。
  • 容易出错: 人累了会写错“咒语”,导致要么抓不到坏蛋(漏报),要么把好人抓了(误报)。
  • 门槛高: 不是谁都会写这种复杂的“咒语”。

虽然现在的 AI(大语言模型 LLM)已经能帮人从报告里提取线索了,但它们不会写“咒语”。它们只能告诉你“坏蛋用了 C:\Users\Public\11.bat",但没法直接给你生成那个能抓所有变种的“搜索咒语”。

3. 解决方案:IOCRegex-gen(自动翻译官)

这篇论文提出的 IOCRegex-gen 系统,就像是一个专门训练过的“咒语翻译机器人”。它不仅能提取线索,还能直接生成完美的“搜索咒语”。

它有两个独门绝技(核心创新):

绝技一:分清“固定部分”和“可变部分”(分组机制)

  • 比喻: 想象坏蛋的作案手法是:“在 C:\Windows\System32 这个固定地点,放一个名字随机的病毒文件”。
  • 人类专家知道: C:\Windows\System32 是固定的,必须死死记住;而文件名是变的,要允许它变化。
  • 普通 AI 的困惑: 它可能把整个字符串都当成固定的,或者把固定部分也当成可变的,导致咒语失效。
  • IOCRegex-gen 的做法: 它有一个**“知识库地图”**(图数据库)。它知道 System32 是系统自带的固定文件夹,而 11.bat 是坏蛋随便起的名字。
    • 它会自动把固定部分标记为“必须匹配”(捕获组)。
    • 可变部分标记为“允许变化”(非捕获组)。
    • 结果: 生成的咒语既精准,又灵活。

绝技二:自我纠错的“试错循环”(推理与验证)

  • 比喻: 就像写代码一样,写完一个“咒语”后,先自己跑一遍测试。
  • 流程:
    1. 生成: AI 先写一个初版咒语。
    2. 调试(Debug): 系统拿这个咒语去试匹配原来的线索。如果匹配不上,就告诉 AI:“你这里写错了,改一下。”
    3. 防过度泛化(Over-Generalization Check): 这是最关键的一步。
      • 问题: 有时候 AI 为了保险,会写一个超级宽泛的咒语,比如“匹配所有东西”。这样虽然能抓到坏蛋,但也会把图书馆里所有正常看书的人(正常文件)都抓进来,造成误报
      • 解决: 系统会随机生成 10 个“无辜路人”(随机字符串)去测试。如果这个咒语把“无辜路人”也抓了,系统就会说:“太宽泛了!不行!重写!”
    4. 打分: 系统会生成好几个版本的咒语,给它们打分。分数高的(既抓得准、又不误伤)被选中,分数低的直接扔掉。

4. 效果:真的好用吗?

研究人员用3000 多份真实的威胁报告MITRE ATT&CK 框架(一个像“黑客模拟考卷”一样的权威测试平台)进行了测试。

  • 命中率(抓得准): 生成的咒语能抓到 99.1% 的真实攻击痕迹。
  • 误报率(抓错人): 只有 0.8% 的误报。
  • 对比: 如果直接让 AI 写咒语(不加这套复杂的纠错和分组机制),效果会差很多(命中率低,误报高)。

总结

这篇论文就像是给网络安全团队配备了一个不知疲倦、精通“咒语”的超级实习生

  • 以前: 分析师要熬夜读报告,手动写复杂的搜索代码,累得半死还容易出错。
  • 现在: 把报告扔给 IOCRegex-gen,它自动分析哪里是固定的、哪里是变的,生成完美的搜索咒语,还能自我检查,确保不误伤好人。

这让安全团队能从繁琐的“写代码”工作中解放出来,把精力集中在真正复杂的威胁分析上,让图书馆(网络安全系统)更安全、反应更快。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →