Mastermind: Strategy-grounded Learning for Repository-Scale Vulnerability Reproduction
本文介绍了 Mastermind,这是一个通过训练规划器来学习并迁移高层策略,从而提升仓库级漏洞复现能力的双环框架,该框架在 CyberGym 上实现了 84.5% 的通过率,并显著超越了多种冻结 LLM 执行器的现有基准。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图在一个巨大的、复杂的机器(比如一个庞大的代码库)中寻找一个非常特定且隐藏的缺陷。为了证明这个缺陷确实存在,你必须打造一把微小的、定制的钥匙(即“概念验证”或 PoC),使其能够完美地契合锁孔,从而让机器以特定的方式崩溃。如果你能做到这一点,你就找到了那个漏洞。
这篇论文认为,问题并不在于“工人”(AI)不擅长制造钥匙或转动钥匙,而在于工人一直在尝试错误的钥匙,或者在错误的房间里寻找。他们执行动作很高效,但制定计划的能力很差。
以下是该论文提出的解决方案——Mastermind 的工作原理,我们使用简单的类比来解释:
问题所在:“忙碌却迷失”的工人
想象一位非常熟练的机械师(AI 执行器),他可以使用任何工具,打开任何门,并修理任何引擎。然而,如果你告诉他:“去寻找损坏的部件,”他可能会花几个小时去检查收音机、轮胎和座椅,却完全忽略了引擎块——那里才是真正的故障点。
最近的 AI Agent 就很像这位机械师。他们可以完美地执行指令,但由于缺乏一个关于“先去哪里看”的良好策略,他们经常在死胡同里浪费时间。
解决方案:Mastermind(“将军”与“书记员”)
Mastermind 将工作拆分为两个截然不同的角色,将思考与执行分离。
- 将军(规划者): 这是学习的部分。他并不接触工具或机器。他的唯一任务是写一张简短、清晰的地图(即“策略”),例如:“前往引擎室,检查燃料管,并尝试顺时针转动阀门。”
- 书记员/工人(执行器): 这是一个被冻结的 AI(例如 GPT-5.5),它负责实际的操作。它阅读将军的地图并执行动作。它不会被改变或重新训练;它只是听从命令。
Mastermind 如何学习:“双环”系统
论文引入了一个巧妙的两部分学习系统,旨在让“将军”写出更好的地图:
环路 1:“笔记簿”(经验环路)
想象将军为这台特定的机器保留了一本笔记本。如果将军说“检查燃料管”,而工人发现并没有问题,将军就会在笔记本上写下:“燃料管正常;下次不要再检查它了。” 这个笔记本是临时的,且针对当前任务。它能帮助将军在下一次处理这台机器时避免重蹈覆辙。环路 2:“大脑训练”(策略环路)
这是将军真正变得更聪明的地方。在尝试了许多种不同的机器并进行了多次尝试后,将军会查看自己的笔记本并询问自己:“当我写下‘检查燃料管’时,通常奏效吗?当我写下‘检查轮胎’时,通常会失败吗?”
该系统使用一种奖励机制(类似于视频游戏得分)来告诉将军:“做得好,那个策略导致了崩溃!”或者“做得不好,那是在浪费时间。”将军通过更新其内部大脑(权重)来学习通用的规则,关于如何寻找缺陷,这样它就可以将这些规则应用到它从未见过的新机器上。
为什么这很重要
论文在名为 CyberGym 的基准测试上进行了测试,该测试包含数百个真实的现实世界代码漏洞。
- 没有 Mastermind 时: 如果你让 AI 进行随机猜测(甚至同时尝试 8 个随机猜测),它能解决约 63% 的问题。
- 有了 Mastermind 后: 通过教 AI 制定更好的策略,它使用了相同的底层 AI 执行器,解决了 84.5% 的问题。
核心启示
论文声称,对于复杂的软件任务,策略比原始力量更重要。
把它想象成一场寻宝游戏。你可以拥有最强壮、跑得最快的选手(AI 执行器),但如果他们没有一份好的地图(策略),他们只会原地打转。Mastermind 教会 AI 如何绘制更好的地图。一旦 AI 学会了如何绘制好地图,它就可以把那份地图交给任何选手(即使是更小或不同的 AI),他们都能更好地找到宝藏。
简而言之: Mastermind 并不是让 AI 更有力地挥动手脚,而是让 AI 更聪明地决定在哪里挥动手脚。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。