← 最新论文
💻 computer science

xOffense: An Autonomous Multi-Agent Framework for Penetration Testing with Domain-Adapted Large Language Models

本文介绍了xOffense,这是一个由领域自适应的Qwen3-32B大语言模型驱动的自主多智能体框架,能够自动化渗透测试工作流,并在严格基准测试中展现出优于VulnBot和PentestGPT等现有系统的卓越性能。

原作者: Phung Duc Luong, Le Tran Gia Bao, Nguyen Vu Khai Tam, Dong Huu Nguyen Khoa, Nguyen Huu Quyen, Van-Hau Pham, Phan The Duy

发布于 2026-04-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Phung Duc Luong, Le Tran Gia Bao, Nguyen Vu Khai Tam, Dong Huu Nguyen Khoa, Nguyen Huu Quyen, Van-Hau Pham, Phan The Duy

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图闯入一座高安保建筑以测试其门锁。过去,你需要一支人类专家团队(渗透测试人员)来逐一穿过大门、撬开锁具并找出薄弱环节。但建筑太多、锁具太多,而专家却远远不够。

此时,xOffense 登场了。请将 xOffense 想象成并非单个机器人,而是一支微型、高度专业化的数字特警队,它们协同工作,自动发现并利用安全漏洞。

以下是论文用通俗语言对该系统的解释:

1. 问题所在:“大脑”与“专家”的博弈

以往尝试自动化的方法主要采用两种路径:

  • “规则手册”机器人:这类机器人如同严格遵循检查清单的机械。如果某扇门不在清单上,它们就无法打开。它们僵化且无法应对意外。
  • “超级大脑”AI:这类方法使用庞大且昂贵的 AI 模型(如 GPT-4)。虽然聪明,但就像聘请一位天才教授去做保洁员的工作。它们成本过高,有时会分心(产生幻觉),且难以记住漫长多步骤任务中的细节。

2. 解决方案:“专业小队”

作者构建了 xOffense,它使用一个中等规模的 AI(一位“专家”而非“天才”),该模型经过专门针对黑客技术的训练。

  • 团队结构:xOffense 没有让一个 AI 试图包揽所有工作,而是将任务拆分为三个专业化的“智能体”(团队成员):
    1. 侦察兵:四处查看以寻找敞开的大门和窗户(侦察)。
    2. 分析师:检查这些门,确认锁具是否脆弱或损坏(漏洞扫描)。
    3. 突破者:实际撬开锁具或砸碎窗户以进入内部(利用)。
  • 指挥者:一个中央“任务编排器”如同指挥家,告知侦察兵何时停止、分析师何时开始,确保它们不会互相干扰,也不会遗忘上一步骤发生的情况。

3. 制胜秘诀:“灰盒”训练

论文强调了两项关键技巧,使这支团队如此高效:

  • “训练手册”(微调):他们使用的 AI 模型(Qwen3-32B)就像一名聪明的学生。研究人员没有只给它一本通用教科书,而是提供了一本特定的“黑客训练手册”,其中包含成千上万个如何入侵系统的真实案例。他们教会它进行逐步思考(思维链),因此它不仅仅是猜测,而是通过推理来解决问题。
  • “灰盒”提示系统:想象你在玩一款电子游戏,你被禁止看到整张地图(黑盒),但游戏会给你一些有用的提示,例如“北墙有一扇门”或“锁已生锈”。这被称为灰盒提示。xOffense 为其 AI 智能体提供来自前序步骤的适量上下文,使它们保持正轨,而无需直接给出答案。这防止了它们迷失方向或遗忘之前的发现。

4. 测试方法

团队通过两种方式测试了 xOffense,就像学生参加两场不同的考试:

  1. 模拟考(AutoPenBench):一套包含 33 个预设挑战的题库,难度从易到难,包括真实世界中著名的安全漏洞(如 Log4Shell)。
  2. 现实世界模拟(AI-Pentest-Benchmark):一套包含 13 台虚拟机的测试集,模拟真实且混乱的计算机网络。

5. 结果:黑马胜出

结果令人惊讶。研究人员发现,他们的小型、专业化团队(xOffense)实际上击败了巨头

  • 它解决了 72.72% 的总任务,击败了庞大的 GPT-4o 及其他巨型 AI 模型。
  • 它成功完成了 79.17% 的独立子任务(如查找特定端口或破解密码)。
  • 即使不使用庞大的“检索”数据库(RAG)来查询答案,它的表现也优于使用更大模型的系统。当他们确实添加了数据库后,表现进一步提升,解决了连最大 AI 都难以攻克的困难现实机器。

6. 结论

论文总结道,你并不需要价值数十亿美元的巨型 AI 来有效入侵系统。相反,一个更小、更便宜、开源的 AI,经过专门针对黑客任务的训练并组织成协作团队,能够更好、更快、更可靠地完成工作。

重要提示:作者非常明确,该工具设计用于授权的安全测试、研究以及在受控环境(如实验室或模拟考试)中的教育。他们强调,未经许可将其用于入侵真实系统是非法且不道德的。其目标是帮助防御者在坏人之前发现漏洞。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →