← 最新论文
💻 computer science

CODESIM: Multi-Agent Code Generation and Problem Solving through Simulation-Driven Planning and Debugging

本文介绍了 CodeSim,这是一种新颖的多智能体框架,通过在七个具有挑战性的基准测试中采用类人的、以模拟驱动的规划验证与内部调试方法,实现了最先进的代码生成性能。

原作者: Md. Ashraful Islam, Mohammed Eunus Ali, Md Rizwan Parvez

发布于 2026-04-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Md. Ashraful Islam, Mohammed Eunus Ali, Md Rizwan Parvez

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试教一个非常聪明但略显死板的机器人如何解一道复杂的谜题。过去,如果你让这台机器人编写一个计算机程序来解决数学问题,它往往会先猜一个解,运行它,看到失败,然后尝试修复出错的部分。这就像让学生写一篇作文,用红笔批改出满篇错误后交还,却从未解释其逻辑最初为何出错,只要求他们自行修正。

本文介绍了一个名为CODESIM(代码模拟)的新系统。请将 CODESIM 视为一个由三位专业专家组成的协作团队,他们运用一种独特的技巧:心理模拟

以下是该团队如何运作,借用电影摄制组的类比来说明:

1. 导演(规划智能体)

在编写任何一行代码之前,“导演”率先介入。

  • 他们做什么:他们审视问题并说:“好吧,我们该如何解决?”他们不是盲目猜测,而是回想一部看过的类似电影(即过往的问题)以获取灵感。
  • 魔法技巧(模拟):在将剧本交给演员之前,导演会在脑海中逐场预演电影。他们会问:“如果主角穿过这扇门,剧情是否合理?”
  • 结果:如果脑海中的电影存在剧情漏洞,导演会立即重写计划。他们不会等到电影拍摄完成才意识到故事有缺陷。这确保了在动工之前,蓝图已经坚实可靠。

2. 编剧(编码智能体)

一旦导演批准了计划,“编剧”便接手工作。

  • 他们做什么:他们将导演详细的计划转化为电影的实际语言(即代码)。
  • 过程:他们严格依据已经验证过的计划来撰写剧本。如果计划是好的,剧本大概率也是好的。

3. 剪辑师(调试智能体)

有时,即使计划完美,编剧也会在剧本中出现拼写错误或细微失误。“剪辑师”的作用就是捕捉这些错误。

  • 旧方式:通常,剪辑师只是运行电影,看它在哪里崩溃,然后猜测该如何修复。
  • CODESIM 方式:剪辑师不只是猜测。他们会再次模拟电影,但这次,他们会聚焦于失败的具体场景。他们逐帧(即逐步)追踪动作,以确切看到角色是在哪里走错了方向。
  • 结果:因为他们观看了失败的“心理模拟”,所以确切知道该如何修复该场景。他们无需生成随机的新测试场景,只需修正他们在模拟中亲眼看到的特定逻辑错误即可。

为什么这很重要?

本文认为,以往的方法就像建造房屋,等到屋顶坍塌后才试图修补。CODESIM则像是在铺设任何一块砖之前,先检查蓝图并在脑海中 walkthrough 房屋。

  • 它像人类:人类通常通过可视化步骤来解决问题(“如果我做 X,那么 Y 会发生”)。CODESIM 迫使 AI 也这样做。
  • 它高效:因为团队在早期(规划阶段)检查逻辑,并在调试阶段仔细追踪错误,所以他们不会浪费时间编写本质上就有缺陷的代码。
  • 结果:作者在七项不同的“竞赛”(具有挑战性的数学和编程谜题)中测试了这个团队。该团队的表现优于任何已测试的其他方法,取得了破纪录的分数。例如,在名为 HumanEval 的标准测试中,他们的正确率达到95.1%,创下新高。

核心结论

CODESIM 是一种让 AI 编写代码的更智能的方法。它不再仅仅是“猜测并检查”,而是采用一种模拟驱动的方法:AI 逐步“思考”问题,在编写前检查自身逻辑,并在出错时仔细追踪自身错误。这就像给 AI 戴上了一副眼镜,让它能看见自身思维的逻辑,从而减少错误并获得更优的解决方案。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →