← 最新论文
🤖 AI

Two Heads are Better Than One: Test-time Scaling of Multi-agent Collaborative Reasoning

本文提出了一种用于测试时扩展(Test-Time Scaling)的多智能体系统框架,该框架通过将推理分解为协作上下文来克服单智能体局限性,并通过 M500 数据集、用于自适应引导的“CEO”智能体以及显著优于其基础模型的微调模型进行了验证。

原作者: Can Jin, Hongwu Peng, Qixin Zhang, Yujin Tang, Dimitris N. Metaxas, Tong Che

发布于 2026-08-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Can Jin, Hongwu Peng, Qixin Zhang, Yujin Tang, Dimitris N. Metaxas, Tong Che

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大语言模型是强大的工具,它们可以通过预测句子中的下一个词来进行阅读、写作和解决问题。多年来,研究人员一直试图通过向这些系统喂入更多数据或使其规模更大来让它们变得更聪明。最近,一种不同的方法引起了关注:给模型更多思考的时间后再进行回答。这种被称为“测试时缩放”(test-time scaling)的方法,鼓励模型生成长长的推理链,逐步检查自己的工作。虽然这在处理简单任务时效果很好,但当问题变得过于复杂时,它就会遇到瓶颈。如果单个模型试图独自推理一个困难的数学问题或编程挑战,思维链可能会变得如此冗长且混乱,以至于模型会迷失方向、出错,或者干脆因内存耗尽而崩溃。其结果往往是一个混乱的答案,或者一个在自身思绪重压下崩溃的系统。

为了解决这个问题,来自几所大学和技术公司的研究团队提出了一个结构性的变革。他们并没有要求一个模型承担所有的思考工作,而是构建了一个系统,让多个模型协同工作,每个模型各司其职。想象一下,一群专家围坐在桌旁,每个人都有不同的专长,共同解决一个问题。在这个新设置中,一个智能体充当“招聘员”,识别需要哪些专家;其他智能体则充当“问题解决者”,提出解决方案并互相评判对方的工作;最后由一个“评估员”检查数学逻辑。通过将庞大且混乱的任务分解为这些不同角色之间较小且易于管理的对话,该系统避免了困扰单个过度劳累的大脑的那种混乱。研究人员发现,这种协作式方法使模型能够处理更难的问题而不会迷失方向。

该团队首先创建了一个新的数据集,以教导这些模型如何有效地协同工作。他们从物理、生物和高等数学等领域选择了 500 个难题。利用一个强大的现有模型,他们生成了关于专家团队应如何解决每个问题的详细记录。这些记录包含了对话的每一个步骤:谁被招募了、每位专家提出了什么建议、他们是如何辩论答案以及他们最终如何达成共识。随后,研究人员利用这个数据集来训练开源模型,教它们识别并复制这些协作模式。其目标不仅是提高模型在数学方面的智能,更是要教它们如何以一种结构化的方式与他人进行协作的特定技能。

为了使这个系统更加有效,研究人员引入了一个特殊的“CEO”智能体。在人类群体中,缺乏指导会导致无休止且毫无成效的争论。CEO 智能体扮演着领导者的角色,监控讨论的进展。它决定团队何时解决了问题、何时需要引入更多专家,以及每一步应该分配多少时间或计算资源。该智能体会根据任务的难度动态调整推理的深度。如果问题很简单,团队就会快速移动;如果问题很复杂,CEO 则会确保团队深入挖掘,分配更多资源以找到正确答案。这种自适应策略防止了系统在简单任务上浪费精力,也防止了在困难任务面前过早放弃。

这种方法的成果在包括常识问题、高等数学和计算机编程在内的广泛挑战中得到了测试。在协作数据集上训练的模型表现显著优于其原始版本。在多智能体框架内工作时,这些新模型解决复杂数学问题的准确度达到了匹配甚至超过一些最先进的闭源系统的水平。例如,在处理一组困难的数学竞赛题目时,协作模型相比于仅受训于独立工作的模型,其成功率有了戏剧性的提升。这项研究证明了协作能力是一种可以学习和精进的技能,而且由多个较小的专业化模型组成的团队可以取得与规模大得多的单个模型相当的结果。

研究人员在实验过程中还观察到了一些意想不到的情况。有时,即使其他智能体都没有提出异议,CEO 智能体也会发现解题过程中一个细微的错误。随后,CEO 会引导团队重新检查他们的工作,从而得出修正后的答案。这表明训练过程已经培养出了一种“集体警觉性”,即整个系统作为一个整体,比其中的任何单个部分都更能发现自身的错误。这项研究证实,通过将人工智能构建为协作团队而非孤独的思考者,我们可以克服当前技术的局限性,构建出更稳健、更可靠、且能处理最复杂问题的系统。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →