← 最新论文
💻 computer science

Evaluating Retrieval-Augmented Generation for Explainable Malware Analysis

本文通过实证表明,检索增强生成(RAG)往往因引入噪声和无关上下文而降低恶意软件解释的质量,这表明在已有结构化证据的情况下,将恶意软件分析视为信号提取任务而非知识检索问题更为恰当。

原作者: Jayson Ng, Amin Milani Fard

发布于 2026-05-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Jayson Ng, Amin Milani Fard

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一名侦探,正在试图解开一个谜团:为什么这个电脑文件表现得像个罪犯?

在网络安全领域,分析师拥有一个名为VirusTotal的庞大数据库。将这个数据库想象成一份超级详细的警方报告。它精确列出了该文件的行为:“它打开了一扇门”、“它复制了一个文件”、“它拨打了一个可疑的电话号码”。所有信息都清晰、结构化地呈现其中。

最近,安全专家开始利用AI 侦探(大型语言模型,即 LLM)来阅读这些警方报告,并撰写清晰的叙述,解释为什么该文件是恶意的。

核心问题:我们需要为 AI 配备一个“图书馆”吗?

人工智能领域有一个流行的概念叫RAG(检索增强生成)。其逻辑如下:“如果我们的 AI 侦探正在撰写故事,那就让它先查阅一个包含额外书籍的图书馆。也许它需要查阅其他犯罪故事中‘打开一扇门’通常意味着什么,以便写出更好的解释。”

本文的作者决定测试一下,当警方报告(VirusTotal)本身已经完美且完整时,这个“图书馆”是否真的有所帮助。

实验:带图书馆与不带图书馆的 AI 侦探

研究人员设计了一项测试,包含两组 AI 侦探:

  1. A 组:阅读 VirusTotal 报告并撰写解释。
  2. B 组:阅读 VirusTotal 报告,此外,AI 还前往“图书馆”,抓取了一些关于恶意软件的额外书籍,并试图将这些故事融入解释中。

他们使用了一种评分系统(称为 BERTScore),来评估 AI 生成的故事与“黄金标准”的完美解释之间的匹配程度。

令人惊讶的结果:图书馆让情况变得更糟

研究发现,添加额外的图书馆书籍实际上使 AI 的解释变得更差。

以下是类比:
想象你正在向法官解释一场车祸。你手头有包含车速、刹车痕迹和天气状况的官方警方报告。

  • 没有图书馆:AI 查看报告后说:“该车超速并撞上了树。”(清晰、准确)。
  • 有图书馆:AI 前往图书馆,找到一本关于“树木如何生长”的书,以及另一本关于“限速历史”的书。它试图将这些内容融入故事中。突然间,解释变成了:“该车超速,虽然树木通常生长缓慢,但这棵树被一辆快车撞了,这让我们想起了 20 世纪 90 年代的限速辩论……"

额外的信息没有帮助;它分散了 AI 的注意力。它增加了“噪音”,使故事变得混乱或泛泛而谈。

为什么会发生这种情况?

作者解释说,分析恶意软件就像大海捞针,而不是从头撰写一篇文章

  • VirusTotal 报告已经包含了所有的“针”(具体的恶意行为)。
  • AI 的工作仅仅是提取这些针并告诉你它们的含义。
  • 当你强迫 AI 阅读额外的书籍(RAG)时,它开始关注“稻草”(不相关或弱相关的信息),而不是“针”。它被那些听起来相关但实际上与这个特定文件无关的故事搞糊涂了。

对安全团队的启示

本文得出结论,针对这项特定工作(基于完整报告解释恶意软件),少即是多

  • 不要过度复杂化:如果你已经掌握了全部事实,就不要强迫 AI 查阅额外信息。这只会导致 AI 产生幻觉或分心。
  • 信号与噪音:这项工作的目标是从数据中提取清晰的信号,而不是从图书馆中综合新知识。
  • 更好的工具:安全工具不应采用“图书馆”方法,而应专注于帮助 AI 更仔细地阅读现有报告,例如通过更好地组织事实或忽略无关的干扰。

简而言之:当证据已经就在你眼前时,把 AI 送到图书馆只会让它忘记自己原本应该关注什么。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →