CodeRescue: Budget-Calibrated Recovery Routing for Coding Agents
本文介绍了 CodeRescue,这是一个预算校准的恢复路由框架,它利用执行反馈和符合性风险控制(Conformal Risk Control)来动态决定是在编码智能体中进行廉价的自我恢复还是模型升级,从而在显著降低成本的同时,实现了比现有基准更高的解决率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
技术摘要:CodeRescue:面向编程智能体的预算校准恢复路由
1. 问题定义
本文探讨了在可执行环境中部署**编程智能体(coding agents)**时面临的挑战。在这些环境中,失败尝试会产生可操作的反馈(例如编译器错误、测试失败、stderr 追踪),而不仅仅是错误的输出。现有的成本感知系统通常将模型失败视为一个二元决策:立即升级到更强大、更昂贵的模型。
作者认为,这种方法对于编程任务并非最优,因为执行反馈可以使廉价模型进行进一步尝试变得有意义。这产生了一个预算化部署问题:当智能体失败时,它应该通过消耗更多廉价计算资源来修复方案(反思/Reflect),还是重新规划(重计划/Replan),亦或是升级到更强的模型(升级/Escalate)?
该问题被形式化为失败后恢复路由(post-failure recovery routing)。给定廉价模型的初始尝试失败后,系统必须在三种异构动作中做出选择:
- 反思(Reflect): 利用执行反馈修正现有的解决方案。
- 重计划(Replan): 使用廉价模型从不同的计划生成全新的解决方案。
- 升级(Escalate): 将问题(连同反馈)移交给更强大、更昂贵的模型。
目标是在满足用户指定的平均恢复预算()的前提下,最大化解决率(solve rate),且无需为每个新的预算约束重新训练策略。
2. 方法论
2.1 有监督恢复路由
核心组件是一个基于离线执行轨迹训练的有监督路由(supervised router)。
- 输入: 恢复上下文 ,包含问题陈述、执行判定结果以及 stderr 追踪。
- 标签化: 对于每个失败的实例,其“预言机(oracle)”标签定义为解决该实例的所有动作集合 中最便宜的成功动作()。不包含无法通过任何动作解决的实例。
- 训练: 通过交叉熵对语言模型(如 Qwen3.5-4B)进行微调,以预测最便宜的成功动作。路由根据对数概率对动作进行评分,并通过 softmax 进行归一化。
2.2 成本正则化策略
为了实现不同预算下的部署而无需重新训练,作者引入了一个成本惩罚项 。策略 选择最大化以下内容的动作:
其中 是路由器的得分, 是估计的部署成本。
- 随着 增加,策略会向更便宜的动作(反思/重计划)偏移。
- 这产生了一个由单个训练好的路由器推导出的离散成本-质量前沿面(cost-quality frontier)。
2.3 符合性预算校准 (CRC)
为了在具有统计保证的情况下为特定用户预算 选择适当的 ,作者应用了符合性风险控制(Conformal Risk Control, CRC)。
- 机制: 利用一组留出的校准集(held-out calibration set)中的失败实例,系统计算各种 值下的经验平均成本。
- 选择规则: 选择满足有限样本预算约束的最宽松惩罚项 :
其中 是已知的成本上限,加法项提供了留一法(leave-one-out)符合性修正。 - 保证: 在交换性(exchangeability)假设下,该程序保证了部署策略在未来测试数据上的期望平均恢复成本不会超过 。至关重要的是,该保证适用于成本而非解决率,这允许动作之间存在非单调的成功模式。
3. 核心贡献
- 失败后恢复路由: 本文将编程智能体的恢复建模为一个针对异构动作(反思、重计划、升级)的路由问题,而非简单的级联到更强模型的过程。
- 预算可控部署: 引入了经 CRC 校准的成本惩罚,使得单个训练好的路由器可以在多个预算点上运行并具备边际期望成本控制能力,消除了为不同预算约束重新训练的需求。
- 经验恢复权衡: 研究提供了经验证据,表明廉价恢复与模型升级表现出互补的成功模式(即:某些失败只能通过廉价动作解决,某些只能通过升级解决,而另一些两者皆可),从而形成了一个离散的成本-质量前沿面。
4. 实验结果
系统在五个编程基准测试(APPS, TACO, BigCodeBench, LiveCodeBench, CodeContests)上进行了评估,使用 GPT-5.4-NANO 作为廉价模型,GPT-5.4 作为强力模型。
- 路由有效性: 学习到的路由器显著优于固定动作基线。无约束的学习型路由器在平均成本为 5.51 m 时仅为 68.6%。
- 互补性: 对“最便宜成功动作”的分析显示,28% 的失败仅能通过廉价动作解决,45% 仅能通过升级解决,27% 则两者皆可。这种异构性证明了使用路由器而非固定级联的必要性。
- 预算校准: CRC 校准的前沿面表明,在预算为 2.56 m$ 时,系统实现了 71.7% 的解决率。这不仅超过了“始终升级”基线(68.6%),而且仅使用了“始终升级”策略平均成本的 35%。
- 基线对比: 学习型路由器优于仅基于提示词的路由器(零样本 LLM 充当路由器)和二元级联基线,证实了路由信号需要通过从轨迹中学习,而非仅仅依靠提示工程。
5. 重要性与主张
本文主张,将编程失败视为一个可诊断的修复问题而非简单的能力差距,可以实现更高效的资源分配。通过 CRC 将路由器的训练与部署预算解耦,该系统提供了一种实现预算控制推理的实用机制。
作者强调,其方法并不声称对解决率进行符合性控制;相反,它提供的是成本保证,而解决率的提升属于经验观察。这项工作表明,对于编程智能体而言,“最便宜且有效的下一步”往往不是最强的模型,而是针对失败模式定制的特定恢复动作,并且这一决策可以在严格的预算约束下动态做出。
作者注明的局限性:
- 恢复被建模为单次失败后的决策,而真实的智能体可能会进行多轮迭代。
- “最便宜成功”标签是一个代理指标,而非校准后的概率估计。
- CRC 控制的是期望成本而非解决率,这意味着质量的提升仍属于经验性的观察。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。