Scrouting: Cost-Aware Routing of Coding Agents by Scouting the Repository First
SuperScout 是一个高性价比的框架,它通过部署一个轻量级的“搜索者”智能体来探索代码库并生成经过验证的结构化交接,从而使路由程序能够将软件修复任务分发给前沿模型,其单次解决成本仅为前沿模型的约五分之一,同时能达到最佳单模型的性能水平。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个计算机可以编写代码来修复损坏软件的世界,但雇佣这些 AI 程序员的费用极其昂贵。把这些“AI 程序员”想象成一支精英侦探团队:有些是超级巨星,几乎能解决任何谜题,但每小时收费高得惊人。另一些则是聪明且有能力的侦探,成本仅为前者的一小部分,但可能会错过一些更微妙的线索。长期以来,这个领域面临的一个大问题是:“我们如何针对特定的案件决定雇佣哪位侦探?”大多数人试图仅仅通过阅读问题的描述(即“问题文本”)来进行猜测,希望以此预测廉价侦探是否足够胜任,还是需要请出那位昂贵的超级巨星。
但问题在于:仅仅阅读问题描述,就像是只看警察报告而不去犯罪现场调查一样,试图通过这种方式破解案件。你即将阅读的这篇论文探索了一个更聪明的想法:如果我们先派出一名小巧、廉样的侦探去犯罪现场进行初步侦察呢?这名侦察员并不试图解决整个谜团,他们只是四处观察,寻找损坏的部分,并写一份快速的、经过验证的报告。然后,一位经理会根据这份报告来决定聘请哪位侦探。这种被称为“侦察”(scrouting)的方法表明:了解问题的“上下文”(context)比仅仅根据问题的标题进行猜测要重要得多。
SuperScout 的故事:先侦察再破案的侦探
认识一下 SuperScout,这是一个旨在不破坏预算的情况下修复软件漏洞的新系统。开发团队意识到,以往雇佣 AI 程序员的方式效率低下。通常,一个路由程序(决策者)在查看漏洞报告后会立即挑选一个模型。但作者发现了一个令人惊讶的事实:如果你观察过去软件修复的结果,那些“超级巨星”模型几乎能解决廉价模型能解决的所有问题,外加一些额外的难题。这意味着,试图通过“为准确率而路由”(即为了获得最多的修复结果而挑选完美模型)是一条死胡同;你无法真正超越始终雇佣最贵模型的做法。
于是,团队改变了策略。他们的目标不再是追求完美,而是实现成本感知(cost-aware)。他们的目标不是解决比最强模型更多的难题,而是以极低的成本解决相同数量的问题。
三幕剧:侦察、验证与派遣
SuperScout 系统运作起来就像一条三步走的流水线:
- 侦察员 (SuperScout-7B): 首先,一个拥有 70 亿参数的小型 AI 模型(可以把它想象成一名初级实习生)被派往软件仓库。它的任务不是修复漏洞,而是探索代码,找到涉及的具体文件,并尝试编写一个能够证明该漏洞存在的测试用例。它会生成一份“交接文档”——一份包含嫌疑文件、重现测试和侦探笔记的结构化笔记。
- 安全门 (验证后剔除): 这里有一个神奇的技巧。实习生的笔记并不会被盲目信任。在主侦探看到笔记之前,一个“沙盒”(一个安全、隔离的测试环境)会运行实习生的重现测试。如果测试未能实际破坏代码(意味着实习生在凭空捏造或出错),那么该项主张就会被剔除并丢弃。只有经过验证的真实事实才能进入下一步。
- 简历路由器: 最后,一位经理会查看任务以及实习生的“隐藏想法”(侦察模型的内部数据状态),以决定聘请哪位“修复者”。候选的修复者包括四种不同的前沿 AI 模型,涵盖了从廉价到昂贵的各种档次。路由器会挑选它认为能胜任工作的最便宜的模型。如果实习生没有发现任何问题,修复者就直接根据原始的漏洞报告进行工作。
大揭秘:交接文档才是核心驱动力
当团队在 266 个真实的 Python 软件漏洞(一个被称为 SWE-bench Pro 的巨大挑战)上测试 SuperScout 时,结果令人震惊。
- 得分: SuperScout 解决了 266 个任务中的 159 个。
- 竞争对手: 单个表现最好的、最昂贵的模型(Claude Opus 4.6)解决了 266 个任务中的 158 个。
- 成本: SuperScout 实现这一结果的成本约为 每个解决任务 0.23 美元,而昂贵的单体模型成本为 每个解决任务 1.27 美元。这大约仅为 五分之一的成本!
然而,最令人着迷的发现并不是关于路由器的决策过程。当研究人员完全移除路由器,并将每一个任务连同实习生的验证交接文档一起发送给最便宜的模型(Kimi K2.5)时,它同样解决了 159 个任务——这与完整的 SuperScout 系统表现完全一致。
这表明,经过验证的交接文档才是真正的英雄。通过侦察仓库并提供一份经过验证的报告,这种行为将廉价模型的性能提升到了如此高度,以至于它们可以媲美昂贵的模型。路由决策本身并没有增加太多魔力;它只是确保了廉价模型能够获得这份交接文档。
为什么这很重要(以及它不是什么)
论文明确排除了以下几种情况:
- 为准确率而路由是徒劳的: 你无法通过仅根据问题文本切换模型来提高解决任务的数量;最好的模型始终是赢家。
- 交接文本不是给路由器的: 有趣的是,将实习生报告的文本内容喂给路由器反而让效果变差了。路由器在利用侦察模型的“隐藏状态”(其内部大脑活动)而非书面笔记时表现更好。笔记是给修复者的,而不是给经理的。
- 它不是解决一切的神器: 该系统是在特定的 266 个 Python 任务集上进行的测试。虽然侦察模型展示了它可以在从未训练过的语言上工作,但在其他基准测试上的完整系统表现仍有待测试。
作者谨慎地指出,这并非一个“永久解决”的问题。结果是针对这组特定任务和当前模型的。然而,其机制是稳健的:通过先派出一名小规模侦察员来验证事实,你可以重新分配解决问题的能力。交接文档提升了廉价模型的水平,使其几乎能与昂贵的模型并驾齐驱,而侦察员的成本微乎其微(每个任务不到 0.5 美分)。
简而言之,SuperScout 教会我们,在 AI 编程的世界里,上下文才是王道。不要仅仅根据职位描述来猜测该雇佣谁;先派一名侦察员去现场,验证他们的发现,然后让最能胜任工作的廉价工人来完成工作。这是一种更聪明、更省钱的构建软件的方式,它证明了有时,最好的省钱方法是先做一点功课。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。