Quantifiable Uncertainty: A Stochastic Consensus Multi-Agent RAG Framework for Robust Malware Detection
本文介绍了 MAGMA,一种随机共识多智能体检索增强生成框架,通过将语义代码检索与概率验证解耦以量化认知不确定性并有效拒绝模糊样本,从而提升鲁棒恶意软件检测能力,实现了 98.4% 的检测率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你是一家高科技银行的保安。你的工作是发现试图潜入的小偷(恶意软件)。
长期以来,保安们使用一种简单的方法:他们 memorize 已知小偷的面孔。如果一张脸与他们书中的照片匹配,他们就会拉响警报。这就像传统的防病毒软件。但狡猾的小偷开始戴上面具、改变发型或使用假身份证(结构变异)。只关注表面的保安们被愚弄了。他们会自信地说:“那是一位普通顾客”,尽管那其实是一个伪装的小偷。这就是论文所称的“自信的错误”。
这篇论文的作者,由 ElMouatez Billah Karbab 领导,构建了一个名为 MAGMA 的新系统来解决这个问题。MAGMA 不像只是看照片,它像一个专家侦探团队,不只是猜测——而是进行调查。
以下是 MAGMA 的工作原理,分解为简单的步骤:
1. 双镜头相机(双流提升)
当新文件到达时,MAGMA 不仅仅查看原始代码(那就像一团混乱的数字)。它同时使用两个不同的“镜头”来查看文件:
- 汇编镜头:这查看底层的机械指令(就像汽车的发动机部件)。它确切地看到机器是如何构建的。
- 伪代码镜头:这查看高层逻辑(就像汽车的使用手册)。它理解代码试图做什么,而忽略混乱的细节。
通过使用这两个镜头,MAGMA 能够看穿诡计。如果小偷改变了发动机部件使其看起来不同(汇编),汽车的逻辑(伪代码)通常保持不变。如果他们改变了逻辑,发动机部件通常会暴露他们。
2. 侦探的图书馆(检索增强生成)
MAGMA 不是试图 memorize 每一个可能的小偷,而是拥有一个巨大的经过验证的“决策关键函数”(DCFs)图书馆。这些是已知具有恶意性质的代码片段,就像针对特定犯罪行为的“通缉令”。
当新文件到达时,MAGMA 不猜测。它立即搜索其图书馆,查看文件的代码是否与这些“通缉”片段匹配。这将系统建立在真实证据之上,而不仅仅是猜测。
3. 侦探陪审团(随机共识集成)
这是最独特的部分。MAGMA 不是让一个侦探做决定,而是将证据发送给五个不同的 AI 侦探(代理)。
- 这些代理是相同的,但被要求带有一点“随机性”进行思考(就像让他们考虑不同的可能性)。
- 他们都独立地查看证据并投票:“有罪”(恶意)或“无罪”(良性)。
4. 两个记分卡(FES 和 ECS)
在五个侦探投票后,MAGMA 计算两个分数来决定采取什么行动:
- 分数 1:证据强度(FES):这问:“证据有多强?”如果侦探们发现与已知“通缉令”完美匹配,这个分数就高。如果他们只是在猜测,分数就低。
- 分数 2:冲突分数(ECS):这问:“侦探们在争论吗?”
- 如果所有 5 个侦探都同意,分数就低(高置信度)。
- 如果 3 个说“有罪”而 2 个说“无罪”,分数就高。这意味着文件令人困惑或棘手。
5. “我不知道”按钮(拒绝策略)
在旧系统中,保安必须说“有罪”或“无罪”,即使他们不确定。这导致了错误。
MAGMA 有第三个选项:“不确定”。
- 如果冲突分数太高(侦探们在争论),MAGMA 拒绝做出最终裁决。
- 相反,它标记该文件并说:“这对机器来说太令人困惑了。请将其发送给人类专家审查。”
结果
该论文在数千个真实恶意软件样本上测试了该系统,包括那些通过改变形状来隐藏的非常棘手的样本。
- 旧系统:被诡计搞糊涂了,并犯了自信的错误。
- MAGMA:捕获了 98.4% 的恶意软件。
- 安全网:当 MAGMA 不确定时,它会停下来并寻求帮助,从而防止其犯下“自信的错误”。
权衡
论文承认存在成本。因为 MAGMA 使用五个侦探并搜索图书馆,检查文件需要更长时间(约 42 秒),而旧系统只需几分之一秒。
作者建议 MAGMA 不应取代快速的首次扫描器。相反,它应作为二线专家,处理快速扫描器无法决定的棘手文件。这就像安全摄像头只是拍照,而法医专家团队分析照片以破案之间的区别。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。