← 最新论文
💻 computer science

CodePori: Large-Scale System for Autonomous Software Development Using Multi-Agent Technology

本研究介绍了 CodePori,这是一个用于自主软件开发的大规模多智能体系统,并通过参与者反馈对其在现实世界中的适用性进行了实证评估,旨在识别标准基准指标之外的关键挑战与机遇。

原作者: Zeeshan Rasheed, Muhammad Waseem, Kai-Kristian Kemell, Aakash Ahmad, Malik Abdul Sami, Mika Saari, Jussi Rasku, Pekka Abrahamsson

发布于 2026-07-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Zeeshan Rasheed, Muhammad Waseem, Kai-Kristian Kemell, Aakash Ahmad, Malik Abdul Sami, Mika Saari, Jussi Rasku, Pekka Abrahamsson

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心理念:数字施工队

想象一下,你想建造一座宏大且复杂的房屋(一个大规模软件系统)。在过去,你必须雇佣一位大师级的建筑师,他必须独自完成绘制每一张蓝图、铺设每一块砖头以及安装每一根水管的工作。这既缓慢又令人精疲力竭。

这篇论文介绍了 CodePori,它是一个全新的系统,就像一支完全由 AI 机器人组成的数字施工队。它不再是让一个机器人尝试完成所有事情,而是使用一个由六个专业 AI 智能体(机器人)组成的团队,根据你给出的简单描述,从零开始协作构建软件。

团队如何运作(六个智能体)

研究人员设计了一个特定的工作流,每个机器人都有独特的工作,就像真实的建筑工地一样:

  1. 经理 (The Manager): 你告诉这个机器人:“我想要一间带厨房和两个卧室的房子。”经理会将这个宏大的想法分解成一份详细的任务清单。
  2. 建筑师 (The Architect): 这个机器人根据清单绘制蓝图,决定房间如何连接以及管道该如何布置。
  3. 组织者 (The Organizer): 这个机器人负责搭建实际的场地。它创建文件夹和文件(即“房间”和“墙壁”),确保代码存放得井井有条。
  4. 建造者 (The Builder): 这是苦干型的角色。它编写系统各部分的实际代码,就像铺设砖块和布线一样。
  5. 检查员 (The Inspector): 当建造者完成一个部分后,检查员会对进行检查。如果他们发现砖块松动或电线位置错误,他们不会亲自动手修复,而是将问题退回给建造者,并附上一张便条说:“修好这个。”
  6. 工头 (The Foreman): 这个机器人负责最后的巡视。它确保整座房子已经准备好可以入住,确保没有遗留任何未完成的细节。

实验:让团队接受测试

研究人员不仅构建了这个团队,还让他们投入实战。他们邀请了 118 名学生(正在学习 AI 的学生)来充当“客户”。

  • 任务: 每位学生向系统提交了 五个不同的项目构想(范围从简单的游戏到复杂的 AI 工具)。总计,该系统尝试构建了 590 个不同的软件项目
  • 目标: 观察这个 AI 团队是否真的能在没有人类全程手把手指导的情况下,构建出一个完整的、可运行的软件系统。

他们的发现(结果)

好消息(优势)

这个 AI 团队表现得非常快速且有条理。

  • 速度: 平均而言,该团队能在约 9 分钟内生成整个项目。这就像你还没吃完开胃菜,披萨就已经送到家了。
  • 结构: “组织者”智能体在保持整洁方面做得很好。代码带有清晰的文件夹和文件,使得查找非常容易。
  • 理解力: 系统通常能很好地理解用户的需求,并将其转化为计划。
  • 文档: 它甚至编写了“用户手册”(代码中的注释),解释了不同部分的功能。

坏消息(挑战)

尽管速度很快,但这个团队并不完美。学生们发现了施工过程中的几个“漏洞”:

  • 幻觉(“虚构的”房间): 有时,AI 会创造出一些并未被要求的物品。例如,如果你要求一个简单的计算器,AI 可能会决定你还需要一个数据库来存储数据,尽管你并不需要。这就像建筑师在只需要车库的房子里加建了一个游泳池。
  • 短期记忆缺失: 随着房屋规模变大,AI 在处理最后一个房间时,有时会忘记它在第一个房间里建造了什么。它可能会尝试将一扇门连接到一个已经不存在的墙上。
  • 代码混乱(代码异味): 有时代码虽然可以运行,但很凌乱。它包含重复的指令或“死代码”(无实际作用的部分),导致后期难以清理。
  • 协作问题: 不同的机器人之间并不总是能完美沟通。有时一个机器人使用的工具是另一个机器人所没有的,导致整个项目崩溃。
  • 复杂度限制: 该系统在构建小型“树屋”(简单的原型)方面表现出色,但在被要求建造“摩天大楼”(非常复杂的系统)时则显得力不从心。

结论:一个有前途的学徒,而非大师

论文得出结论,CodePori 是一个功能强大的工具,展示了巨大的潜力。它可以使软件开发中许多枯燥、重复的工作实现自动化。

然而,它尚未准备好完全取代人类工程师。它仍然会犯错、遗忘细节,有时还会建造一些你并未要求的东西。研究人员表示,要让这项技术在现实世界中真正发挥作用,我们需要:

  1. 给 AI 更好的记忆力,这样它就不会忘记自己的工作。
  2. 添加一个“进度条”,以便人类可以实时看到 AI 正在做什么。
  3. 允许人类介入,并在 AI 卡住时进行修复。

简而言之: CodePori 就像一个非常快、非常有条理,但偶尔会健忘且过于积极的实习生。它可以承担大量繁重的工作,但仍需要人类监督员来检查其工作,并确保最终产品确实是你想要的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →