← 最新论文
💻 computer science

An Empirical Study of Coordination Mode as the First-Class Citizen in From-Scratch Multi-Agent Coding

本文介绍了 MSEval,这是一个针对从零开始的多智能体编程的严谨基准测试,它利用真实的全文栈项目和一个自动化评估框架,旨在证明组织拓扑结构对速度、成本和质量权衡的影响显著,且其重要性往往足以与模型能力相媲美。

原作者: Yanyu Ren, Yunfeng Bai, Xizheng Wang, Li Chen, Dan Li

发布于 2026-07-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Yanyu Ren, Yunfeng Bai, Xizheng Wang, Li Chen, Dan Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下这样一个世界:构建软件不再是单个天才程序员的孤独工作,而是一个由数字工人组成的繁忙建筑工地。这就是**多智能体系统(Multi-Agent Systems)**的领域——在这里,人工智能(AI)不仅仅是编写单行代码,而是通过协作从零开始构建整个应用程序。把它想象成一群朋友试图建造一个树屋:一个人负责设计蓝图,另一个人负责切割木材,第三个人负责粉刷墙壁。但问题在于:如果他们互不沟通,或者因为谁该拥有锤子而争吵,树屋最终可能会变得歪斜、未完工,甚至彻底坍塌。长期以来,科学家们通过询问“一个智能体能否修复一个坏掉的玩具?”来测试这些 AI 团队。但现实世界要复杂得多。它问的是:“一整个团队能否建造出一座摩天大楼,在处理分歧的同时,还能按时完工且不超预算?”这正是研究人员现在正在攻克的重大课题:我们如何衡量一组 AI 智能体是否真的能够协同工作来创造真实的软件,而不仅仅是在假装协作?

于是,MSEval 诞生了。这是一个由清华大学和中关村实验室的研究人员创建的用于测试 AI 团队的新型“健身房”。MSEval 并没有给 AI 团队一份精确到每一颗螺丝钉的预制蓝图,而是给了它们一个粗略的想法——就像老师发的作业要求——然后观察它们如何从头开始构建一个全栈 Web 应用。研究人员设置了一个大规模实验,包含 100 个不同的场景,将 10 个真实世界项目(如在线直播教学平台或即时通讯应用)与 10 种不同的 AI 团队组织方式相结合。有些团队像严格的流水线一样,将工作按链条向下传递;有些则像蜜蜂群一样,随手抓取任务;有些甚至有一个“管理者”AI 在监督所有人,而有些则让智能体之间相互竞争。

该团队不仅关注最终的应用是否可用,还测量了一切。他们追踪了耗时(墙钟时间)、消耗了多少数字货币(Token),以及 AI 需要修复错误的次数。他们使用了一个名为 TAgent 的特殊自动化评分器,它扮演着一名超级严厉的助教角色。TAgent 不仅仅是阅读代码,它还会实际访问实时网站,点击按钮,检查登录功能是否正常,并扫描代码中的隐藏安全漏洞。随后,它会向团队提供具体的反馈,例如:“你的聊天功能可以运行,但你忘了保存消息”,从而允许团队进行重试。

研究结果令人大开眼界。研究发现,团队如何组织,其重要程度不亚于 AI 模型本身有多聪明。事实上,改变团队的“拓扑结构”(即其组织结构)可能会导致最终得分波动超过 30 分,并使完成时间翻倍。例如,智能体在清晰阶段进行任务交接的结构化流水线模式,通常能以最快速度产生最高质量的结果。相比之下,拥有沉重管理监督或混乱“集群”模式的团队往往会陷入泥潭,在争论或重复劳动上浪费时间和金钱。有趣的是,研究人员发现,仅仅拥有更强大的 AI 模型并不保证成功;一个配合更好团队结构的稍弱模型,往往能胜过一个配合混乱的超级智能模型。

论文还揭示,这些 AI 团队很少会完全“崩溃”。相反,它们通常构建出一个可以运行但并不完整的系统。最常见的失败并非灾难性的错误,而是功能的缺失或逻辑上的漏洞——就像一扇门可以打开,但无法上锁。这项研究表明,为了让 AI 团队在未来真正发挥作用,我们需要将它们的协作风格视为一种灵活的工具。我们不应仅仅挑选“最聪明”的 AI 并寄希望于最好结果;我们需要仔细设计它们如何交流、谁拥有项目的哪个部分,以及何时停下来进行修复。MSEval 证明了,在构建软件的竞赛中,秘诀不仅仅是原始的智能,更是协作的艺术。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →