SWE-Manager: Selecting and Synthesizing Golden Proposals Before Coding
本文介绍了 SWE-Manager,这是一个 8B 参数规模的强化学习模型,它通过模仿技术经理的行为,在不执行代码的情况下选择最佳候选方案并合成软件问题的“黄金”解决方案,从而在 SWE-Lancer Manager 基准测试中实现了最先进的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你是一位船长(一个软件项目),而一场风暴袭来了(一个 Bug 或一个新的功能需求)。在你可以操舵之前,你需要决定走哪条路径。
在现实世界中,你的船员不会瞎猜。他们可能会听到三位水手喊出三条不同的路线:
- 水手 A 说:“走穿过暗礁的捷径!很快,但有风险。”
- 水手 B 说:“绕过这座岛屿。很安全,但要花三天时间。”
- 水手 C 说:“我们先修好引擎再出发。这是最彻底的做法,但成本很高。”
通常,人类管理者必须听取这三者的意见,权衡风险,观察天气(问题的具体语境),然后选出最好的计划。这篇名为 SWE-Manager 的论文在问:AI 能学会成为那样的管理者吗?
以下是他们如何构建它的过程,用简单的语言进行了解释:
1. 问题所在:AI 擅长写作,但不擅长抉择
目前的 AI 模型(比如那些写代码的模型)非常擅长生成一个解决方案。但在真实的软件团队中,人们经常会写出多个解决方案,然后针对哪一个更好进行争论。
- 差距: AI 还没有真正被教会如何坐在“管理者的椅子”上,去倾听所有的选项,进行比较,然后说:“好吧,我们决定采用水手 B 的方案,但让我们把它优化得更快一点。”
- 问题在于: 这种“挑选赢家”的技能仅仅是一种随机的人类偏好,还是存在一种 AI 可以学习的逻辑模式?
2. 侦探工作:真正的管理者是如何做事的?
研究人员扮演了侦探的角色。他们查看了 GitHub(一个程序员分享代码的地方)上成千上万条关于如何修复 Bug 的真实讨论。他们发现了人类管理者进行选择时的三个大秘密:
- 秘密 #1:这不是随机的。 管理者并不会随心所欲地挑选。他们总是遵循一些“高层规则”,例如:“这安全吗?”“这会破坏其他东西吗?”“以后容易修复吗?”
- 秘密 #2:这是一个比较过程,而不是单纯的测试。 你不能孤立地判断一个提议。你必须在特定的问题语境下将它们相互比较。(例如:“水手 A 的方案很快,但既然我们正处于风暴中,安全性比速度更重要。”)
- 秘密 #3:最好的计划是融合。 通常,最终的计划并不只是某一位水手的想法。它是一个“黄金提议(Golden Proposal)”,它结合了水手 A 的优点、水手 B 的安全性以及水手 C 的彻底性,并将它们融合成一个完美的计划。
3. 解决方案:SWE-Manager(AI 管理者)
基于这些秘密,团队构建了 SWE-Manager。把它想象成一种新型的 AI,它不只是写代码,它还管理对话。
SWE-Manager 不仅仅是说“这是代码”,它会做三件事:
- 阅读问题: 它理解问题所在。
- 评审候选方案: 它查看所有不同的提议(就像水手们的航线)。
- “黄金”合成: 它挑选出最好的方向,解释为什么它选择了这个方向,然后编写一个新的、“黄金提议”,将所有候选方案中的精华部分结合成一个清晰的指令。
他们训练了一个特定的版本,称为 SWE-Manager-8B(一个拥有 80 亿参数的模型),使用了特殊的两步法:
- 第一步(学校): 他们教它如何进行比较和解释的格式(监督微调)。
- 第二步(实践): 他们让它练习做出选择,并在它选对时给予奖励,从而教会它像管理者一样去“思考”(强化学习)。
4. 结果:AI 管理者有效吗?
他们通过两种方式对 AI 进行了测试:
测试 A:“谁是老大?”测试(选择能力)
他们给 AI 一个问题和三个不同的解决方案,要求它选出人类管理者会选出的那个。
- 结果: SWE-Manager-8B 在 53% 的情况下做对了。
- 对比: 一个非常强大且著名的 AI(GPT-5)仅在 44% 的情况下做对了。尽管 SWE-Manager 是一个更小、更便宜的模型,但它在选择正确路径方面表现得更好。
测试 B:“它能帮助构建吗?”测试(实现能力)
他们建立了一个工作流(称为 P2A),流程如下:
- 一个 AI 编写提议。
- SWE-Manager 挑选出最好的一个,并编写“黄金提议”。
- 第三个 AI 根据该“黄金提议”尝试构建修复程序。
- 结果: 当使用 SWE-Manager 作为管理者时,团队成功修复了 55.6% 的问题。
- 对比: 这优于完全没有管理者的情况(修复率为 48.5%),并且达到了使用巨型 GPT-5 作为管理者的性能水平。
核心总结
这篇论文证明了选择正确的计划是一种 AI 可以学习的技能。
这不仅仅关乎是否有足够的智能去写代码,更关乎是否有足够的智能去比较选项、理解风险,并将最好的想法组合成一条清晰的指令。通过教 AI 扮演“技术管理者”的角色,我们可以让软件开发变得更加可靠和高效,即使是使用规模较小、成本较低的 AI 模型也是如此。
简而言之: 论文表明,如果你教 AI 成为一名优秀的评判者和编辑,它在帮助人类构建软件方面会变得更加出色。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。