← 最新论文
🤖 AI

COMPAS: Difficulty-Aware Joint Search for Optimizing Code Generation

COMPAS 是一个感知难度的框架,通过针对特定的任务难度组联合搜索最佳的模型、提示词和解码设置来优化代码生成,在 LiveCodeBench 和 SWE-bench 等基准测试中显著提升了通过率和成本效率。

原作者: Jingzhi Gong, Jie M. Zhang, Gunel Jahangirova, Dong Huang, Mohammad Reza Mousavi, Mark Harman

发布于 2026-08-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Jingzhi Gong, Jie M. Zhang, Gunel Jahangirova, Dong Huang, Mohammad Reza Mousavi, Mark Harman

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图烤出一个完美的蛋糕,但你有一个会说话的神奇烤箱。在计算机科学的世界里,这个“烤箱”是一个大语言模型(LLM),一个能像人类程序员一样编写计算机代码的超级智能 AI。为了得到最好的蛋糕,你需要选择三样东西:使用哪个烤箱(模型)、给它什么食谱(提示词/prompt),以及如何设置温度和定时器(解码设置/decoding settings)。长期以来,科学家们一直试图寻找一种适用于所有蛋糕——从简单的纸杯蛋糕到复杂的婚礼多层蛋糕——的“唯一完美食谱和烤箱设置”。但他们遇到了一个问题:让纸杯蛋糕蓬松的设置可能会烧焦婚礼蛋糕,而节省面粉成本的设置可能会毁掉味道。大问题在于:如何在不花费巨额资金或耗费多年时间尝试每一种可能性之前,为每一个特定的任务找到完美的组合?

于是有了 COMPAS,一种像一位才华横溢、精打细算的行政总厨一样的全新方法。COMPAS 不再是为所有人制定一个通用的规则,而是意识到不同的任务有不同的“难度等级”。它建议我们将任务进行分组——比如将编程问题分为“简单”、“中等”和“困难”——然后为每个组找到一套独特的完美食谱。研究人员发现,提示词(指令)和解码设置(烤箱旋钮)最好是同时进行微调,而不是分开调整;而且,对一个 AI 模型有效的设置,在另一个模型上可能会失效。通过使用一种聪明的两步走过程——首先为这项工作挑选合适的烤箱,然后将食谱和旋钮一起进行微调——他们为每个难度等级构建了一个“菜单”。当一个新任务到来时,COMPAS 会立即检查其难度,选择该组对应的完美预制菜单,然后开始工作。

在实验中,这种方法取得了巨大的成功。在一个名为 LiveCodeBench 的编程问题测试集上,COMPAS 成功率达到了 52.8%,击败了此前表现最好的方法(仅达到 45.9%)。更棒的是,它在实现这一目标的同时显著降低了成本:成本从 36.57 美元降至仅 4.92 美元。他们还在一个涉及修复整个软件项目漏洞的更复杂挑战(SWE-bench)上进行了测试,解决了 76.0% 的任务,同样优于现有的最佳方法。

COMPAS 的“秘密武器”是它的“难度感知”策略。研究人员通过实验发现了三个关键点。首先,指令和烤箱设置是相互作用的;同时改变两者比分别改变两者效果更好。第二,对一个 AI 模型有益的微调可能会损害另一个模型,因此你必须在开始微调之前仔细挑选模型。第三,也是最重要的一点,“最佳”设置对于简单问题和对于困难问题是完全不同的。一种全球性的、一刀切的方法是行不通的。

为了解决这个问题,COMPAS 采用了两阶段计划。在离线阶段(准备阶段),它根据任务的难度将所有训练任务进行分组。然后,它运行一个快速且廉价的测试来为每个组挑选最佳的 AI 模型。一旦选定了模型,它就会进入“联合搜索”模式,利用一种聪明的反馈循环,同时调整提示词和解码设置。它不仅仅是随机尝试各种组合,而是从错误和成功中学习,为每个难度组构建一个“质量-成本前沿”(quality-cost front)——本质上是一份关于如何在获得良好结果与节省成本之间进行最佳权衡的清单。

在线阶段(实时烹饪),当一个新任务到来时,COMPAS 不会浪费时间去搜索。它只需查看任务的难度标签,找到匹配的组,并从该组的预建菜单中挑选出最佳配置。这就像拥有一个调校完美的食谱库随时待命,所以你永远不必从零开始。

论文表明,这种方法非常稳健。即使他们改变了随机种子(比如像重新洗牌一样改变卡牌顺序)或者在不同类型的 AI 模型上进行测试,COMPAS 始终优于其他方法。它还证明了按难度拆分任务至关重要;如果你忽略难度等级并尝试用一种设置应对一切,你的结果会大幅下降。虽然该方法目前在 AI 模型属于同一“家族”时效果最好,但研究人员表示,未来可以扩展这种方法。目前,COMPAS 是一个强有力的证明,说明在寻找正确设置的过程中,如何聪明地进行搜索与设置本身同样重要。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →