Steer, Don't Solve: Training Small Critic Models for Large Code Agents
本文提出通过训练小型监督微调的评论家模型(critic models)来为大型代码智能体提供轨迹内的转向引导(intra-trajectory steering),证明了与端到端训练或事后评分相比,该方法在显著提升 SWE-bench Verified 等基准测试性能的同时,还降低了计算成本和轨迹长度。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
核心理念:GPS 与 驾驶员
想象你正在尝试开车从纽约前往洛杉矶。你有一位非常出色的驾驶员(代码智能体/Code Agent),他知道如何转动方向盘、踩油门和换挡,动作非常完美。然而,这位驾驶员有时会对“大局观”感到困惑。他们可能会原地打转,或者因为看错了路标而转错弯,甚至会因为认为那是扇门而试图撞墙开过去。
通常,为了解决这个问题,人们会尝试从头开始重新训练驾驶员。但这既昂贵又耗时,而且驾驶员可能仍然会在同样的混乱道路上卡住。
本论文提出了一个不同的解决方案: 我们不是要重新训练驾驶员,而是雇佣一个小型且聪明的 GPS 导航仪(评论家模型/Critic Model)。
- 驾驶员(智能体/Agent): 负责所有的实际工作(编写代码、运行命令)。他们保持原样;我们不改变他们的大脑。
- GPS(评论家/Critic): 不触碰方向盘。相反,它每隔几分钟观察一次驾驶员。如果驾驶员开始原地打转或正朝着悬崖驶去,GPS 会说:“嘿,你在循环!你在尝试修复错误的文件。停下来,重新思考你的策略。”
论文表明,雇佣这个小型 GPS 比雇佣一位超级聪明的真人导航员要便宜得多,并且能帮助驾驶员更快、更频繁地到达目的地。
问题所在:为什么仅仅“训练”是不够的
作者注意到,当你训练大型 AI 代码智能体来解决软件漏洞(bugs)时,它们在机械操作(输入代码、使用工具)方面变得非常出色。但它们往往在策略(构思正确的计划)方面失败。
这就像教学生写文章。你可以教他们完美的语法和拼写(机械操作),但如果他们不知道如何组织思想或如何紧扣主题(策略),文章依然会一团糟。
当你试图让 AI 同时学习这两者时,它会遇到一个“天花板”。它会陷入停滞。作者发现,大约 65% 的失败并不是因为 AI 写了糟糕的代码,而是因为其推理过程存在缺陷。
解决方案:一个“小型的评论家”
团队构建了一个系统,让一个小型的 AI 模型(评论家/Critic)坐在大型编码智能体旁边。
- 设置: 大型智能体尝试解决一个问题。每经过 5 或 10 个步骤,它就会暂停。
- 检查: 小型评论家查看智能体目前为止所做的工作。
- 建议: 评论家给出一个简短的高层级提示。
- 错误的建议: “删除第 42 行并在这里写一个循环。”(这是“后座驾驶/指手画脚”,论文指出这是错误的,因为小型模型并不比大型模型更懂代码)。
- 正确的建议: “你正在重复执行同一个命令三次。你陷入了循环。尝试一种不同的方法。”(这是“引导/转向”)。
- 恢复: 大型智能体阅读建议并继续工作。
他们是如何训练这个 GPS 的
为了教会小型评论家如何给出好的建议,他们并没有仅仅靠猜测。他们使用了一位“老师”(一个极其庞大且昂贵的 AI,名为 Claude-Opus-4.6)来预先生成建议。
- 老师: 这位昂贵的 AI 观察智能体的工作过程,并写下完美的、高层级的建议。
- 学生: 这个小型、廉价的 AI(Qwen3-8B)学习这些笔记。它学习模仿建议的风格(专注于策略,而非具体的代码行),而不需要像老师一样聪明。
关键发现: 论文发现建议的类型最为重要。
- 如果老师给出了具体的代码指令,小型学生就无法很好地学习。
- 如果老师给出的是高层级策略(例如,“你卡住了”、“检查你的假设”),那么小型学生就能完美地学习。
结果:更快、更便宜、更聪明
团队在 SWE-bench 上测试了该系统,这是一个著名的基准测试,包含了 500 个真实的软件漏洞。
- 适用于不同的驾驶员: 他们使用一种类型的编码智能体(CWM-32B)来训练评论家。然后,他们使用这个相同的评论家去帮助两个从未见过的不同编码智能体(Qwen 模型)。
- 结果: 这些新智能体通过聆听评论家的指导,在解决漏洞方面有了显著提升。
- 节省成本: “老师”(Claude-Opus)运行起来非常昂贵。“学生”(Qwen3-8B)则非常微小且廉价。
- 结果: 使用小型评论家的系统比使用昂贵的老师要便宜 30 到 92 倍。
- 确实节省了时间: 在其中一个大型智能体上,评论家不仅让智能体变得更聪明,还让智能体停止了浪费时间。智能体完成任务的速度更快了,这节省了更多的成本。事实上,整个系统(智能体 + 评论家)比智能体单独工作时还要便宜。
“秘诀”
论文强调了该方法奏效的两个主要原因:
- 关注点分离: 智能体专注于执行(编码),而评论家专注于思考(策略)。它们不会为了争夺控制权而产生冲突。
- 拒绝“后座驾驶”: 评论家被严格禁止说“写这一行特定的代码”。它只能说“你走错方向了”。这防止了小型模型给出错误的、具体的指令从而干扰大型模型。
总结
可以将这篇论文看作是构建一个团队而非一个超级英雄的蓝图。与其试图创造一个既能做所有事、又强大且昂贵的单一巨型完美 AI,不如构建一个由一个小型、专业化的教练来引导强大的工作者的系统。
教练不从事实际工作,但通过提供正确的、高层级的启发,工作者能够解决那些仅凭自身力量无法解决的问题,而且整个团队完成工作的速度更快,成本也更低。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。