← 最新论文
💻 computer science

AsmRAG: LLM-Driven Malware Detection by Retrieving Functionally Similar Assembly Code

本文提出了一种名为 AsmRAG 的框架,通过汇编级检索增强生成(RAG)技术,将恶意软件检测从单纯的概率分类转变为基于语义检索的证据分析,从而在应对代码混淆的同时,为安全分析人员提供具有高准确率且可解释的取证依据。

原作者: ElMouatez Billah Karbab

发布于 2026-04-28
📖 1 分钟阅读☕ 轻松阅读

原作者: ElMouatez Billah Karbab

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这是一篇关于网络安全前沿技术的论文。为了让你轻松理解,我们可以把“病毒检测”想象成一场**“警察抓小偷”**的游戏。

1. 现状:现在的“警察”有点笨(传统 AI 的问题)

想象一下,现在的网络安全系统(传统的深度学习模型)就像是一个**“看脸”的保安**。

  • 他们怎么工作? 保安并不真正理解小偷是怎么干坏事的,他只是记住了小偷的一些“外貌特征”:比如穿黑衣服、戴墨镜、走路姿势有点怪。
  • 问题在哪? 如果小偷变了个妆——换了件红衣服,或者戴了个口罩,甚至只是走路换了个节奏,这个保安可能就认不出来了。保安只会告诉你:“我觉得这人有 99% 的概率是坏人”,但他说不出理由。如果你问他:“为什么?”他只会耸耸肩说:“感觉不对。”这就是论文里说的**“黑盒问题”**(缺乏解释性)。

2. AsmRAG 的新招:从“看脸”变成“看作案手法”(核心思想)

这篇论文提出的 AsmRAG,不再是一个只看外表的保安,而是一个**“资深刑侦专家”**。

他不再关心小偷穿什么衣服(代码的语法/外表),他关心的是小偷**“是怎么撬锁的”**(代码的逻辑/语义)。

  • 什么是“语义”?
    小偷撬锁有两种方法:一种是用铁丝捅,一种是用回形针捅。虽然工具不同(代码长得不一样),但**“通过细小金属工具旋转锁芯”**这个动作(逻辑)是一模一样的。
  • AsmRAG 的做法: 它把复杂的电脑程序拆解成一个个细小的“动作片段”(汇编函数)。然后,它把这些动作转化成一种“逻辑指纹”(语义嵌入)。

3. 它是怎么工作的?(三个神奇步骤)

我们可以把 AsmRAG 的工作流程比作**“指纹库比对 + 现场还原”**:

第一步:建立“犯罪手法数据库”(知识库构建)

专家们先把所有已知的小偷作案手法(已知的病毒代码)收集起来,转化成一种“逻辑指纹”,存进一个超级巨大的**“犯罪手法图书馆”**里。

第二步:寻找“关键证据”(锚点函数识别)

当一个可疑的程序进来时,AsmRAG 不会看整个程序,因为它知道程序里有很多“废话”(比如正常的系统运行代码)。
它会像侦探一样,在程序里寻找那个**“最像坏人”的动作**。比如,它发现这个程序里有一个动作:“正在尝试绕过密码校验”。这个动作就是**“锚点”**(Anchor Function)。

第三步:翻阅图书馆并“写报告”(RAG 检索增强生成)

一旦找到了这个“关键动作”,AsmRAG 就会立刻冲进图书馆,搜索:“有没有哪个已知罪犯也做过一模一样的动作?”

  • 如果找到了: 它不仅会告诉你“这是坏人”,还会像写结案报告一样告诉你:“这个家伙是‘病毒家族 X’,因为他在第 5 行执行了和‘病毒家族 X’一模一样的加密逻辑,虽然他换了种写法,但本质没变!

4. 为什么它更厉害?(论文的结论)

  1. 不怕“变装”: 即使病毒通过“变色龙”技术(混淆技术)把自己改得面目全非,只要它的“作案逻辑”没变,AsmRAG 就能一眼认出它。
  2. 能说出“为什么”: 它不再只给一个冰冷的概率数字,而是给出一份有理有据的证据报告,让安全专家能看懂、能信任。
  3. 越用越聪明: 每次警察抓到一个新变种,只要把这个新手法存进图书馆,下次遇到类似的,它就能瞬间秒杀。

总结一下:

  • 以前的 AI: “我觉得他是坏人,因为他穿得像坏人。”(容易被骗,且说不清理由)
  • AsmRAG: “他是坏人,因为他在试图用一种特定的方式撬你的保险柜,这跟我们数据库里那个著名的‘大盗’的手法一模一样!”(精准、专业、有理有据)

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →