← 最新论文
💻 computer science

SEMAG: Self-Evolutionary Multi-Agent Code Generation

本文提出了 SEMAG 框架,通过模拟人类编程实践实现多智能体任务的阶段分解与自适应工作流,并结合自我进化机制自动升级骨干模型,从而在 CodeContests 等基准测试中显著超越现有方法并刷新了 Pass@1 准确率。

原作者: Yulin Peng, Haowen Hou, Xinxin Zhu, Ying Tiffany He, F. Richard Yu

发布于 2026-03-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Yulin Peng, Haowen Hou, Xinxin Zhu, Ying Tiffany He, F. Richard Yu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇文章介绍了一个名为 SEMAG 的新系统,它的核心任务是让计算机自动写代码

为了让你更容易理解,我们可以把写代码的过程想象成建造一座复杂的摩天大楼

1. 以前的方法 vs. SEMAG 的新思路

以前的方法(像是一个固执的包工头):

  • 死板: 不管你是要盖一个简易的狗窝(简单任务),还是要盖摩天大楼(复杂任务),以前的系统都只用同一套流程。
    • 盖狗窝时: 它可能调动了起重机、地质勘探队、甚至请了诺贝尔奖得主来设计,大材小用,浪费钱又浪费时间
    • 盖摩天大楼时: 它却只派了一个实习生拿着锤子去敲,能力不够,导致大楼塌了
  • 工具单一: 它只认得一种“超级工人”(固定的 AI 模型)。如果这个工人今天状态不好,或者出现了更厉害的“新工人”,它也不知道换人,只能硬着头皮继续干。
  • 容易钻牛角尖: 如果第一步走错了,它只会在那一步反复试错,直到累死也走不出来(陷入局部最优解)。

SEMAG 的方法(像是一个智能的“超级工程指挥部”):
SEMAG 模仿了人类顶尖工程师团队的工作方式,它有三个核心绝招:

绝招一:动态调整策略(看菜吃饭)

SEMAG 不会一开始就死磕代码。它像一个经验丰富的总指挥

  • 简单任务(盖狗窝): 它直接说:“别废话,直接动手写!”(Level 1:直接生成)。
  • 中等任务: 它会先说:“先画个草图,大家确认一下没问题再动工。”(Level 2:规划与验证)。
  • 困难任务(盖摩天大楼): 它会说:“光画图不行,先模拟一下受力分析,如果不行就改方案,如果还不行,咱们开个会讨论一下!”(Level 3 & 4:调试、辩论、多轮迭代)。
  • 比喻: 就像你修自行车,如果是链条松了,你直接拧紧就行;如果是发动机坏了,你就得先拆解、诊断、甚至找专家会诊。SEMAG 能自动判断该用哪种“维修力度”。

绝招二:团队协作与“吵架”机制(集思广益)

当代码写错了,SEMAG 不会让同一个 AI 死循环。它会启动一个**“专家会诊室”**:

  • 调试员: 拿着放大镜找代码里的 bug(就像修车师傅听发动机声音)。
  • 解释员: 把代码翻译成大白话,解释每一行在干什么。
  • 建议员: 根据错误日志,提出修改建议。
  • 辩论组(最精彩的部分): 如果修了半天还修不好,SEMAG 会派出几个不同的“专家”进行辩论
    • 专家 A 说:“我觉得是算法错了,得换个思路。”
    • 专家 B 说:“不对,是参数设错了,应该调大一点。”
    • 裁判(决策者): 听取大家的意见,选出最好的方案,然后让“程序员”重新写代码。
  • 比喻: 这就像一群医生会诊。如果一个医生治不好,就换几个医生一起讨论,甚至互相“抬杠”,最后由主刀医生拍板,确保方案是最优的。

绝招三:自我进化(随时换“超级工人”)

这是 SEMAG 最厉害的地方。现在的 AI 模型更新非常快,今天最强的,明天可能就被超越了。

  • 以前的系统: 就像一家只认“王师傅”的装修公司,不管外面出了多厉害的“李师傅”,它都只用王师傅。
  • SEMAG 的“情报员”: 它有一个专门的**“搜索特工”**。这个特工会实时上网搜索:“最近哪个 AI 模型写代码最厉害?”、“有没有新的技术突破?”。
  • 自动升级: 一旦搜到更厉害的模型(比如从 GPT-4 升级到 GPT-5,或者发现 Claude 3.7 更擅长写代码),SEMAG 会自动切换到那个新模型来干活,完全不需要人工干预。
  • 比喻: 就像一支特种部队,如果任务变了,或者发现敌人换了新武器,指挥官会立刻呼叫支援,换上最新型的装备和士兵,而不是死守旧装备。

2. 效果怎么样?

论文里的实验数据非常漂亮,用通俗的话说就是:

  • 更准: 在 7 个著名的编程考试(从简单的填空题到像奥林匹克竞赛一样的难题)中,SEMAG 的得分都打破了历史记录。
  • 更省: 对于简单任务,它不瞎折腾,省下了大量的计算资源(就像盖狗窝不用起重机,省了油钱)。
  • 更强: 在最难的比赛题目(CodeContests)上,如果只用固定的模型,它比以前的最好方法高出 3.3%;如果加上它“自动换最强模型”的功能,准确率直接飙升到 52.6%,遥遥领先。

总结

SEMAG 就是一个“懂变通、会开会、爱学习”的超级代码生成器。

它不再是一个只会死记硬背的机器,而是一个能根据任务难度灵活调整策略,遇到难题能组织团队辩论,并且能实时追踪最新技术并自动升级的智能系统。它让计算机写代码这件事,变得更像人类顶尖工程师的工作方式了。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →