← 最新论文
🤖 AI

MASPRM: Multi-Agent System Process Reward Model

该论文介绍了 MASPRM,一种通过在终端结果上进行训练来为中间智能体消息评分的多智能体系统过程奖励模型,与现有模型相比,它通过实现更有效的步级束搜索和蒙特卡洛树搜索,显著提升了在推理基准测试上的推理时搜索性能。

原作者: Milad Yazdani, Mahdi Mostajabdaveh, Zirui Zhou, Ying Xiong

发布于 2026-07-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Milad Yazdani, Mahdi Mostajabdaveh, Zirui Zhou, Ying Xiong

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在试图解决一个非常棘手的谜题,比如一个复杂的数学问题或逻辑谜题。在人工智能的世界里,我们有“大语言模型”(LLMs),它们就像是超级聪明但有时有些心不在焉的学生。如果你问它们一个难题,它们可能会尝试一次性给出答案,但它们经常会在中途卡住,或者在早期出错后沿着错误的路径一直走下去。为了解决这个问题,科学家们开始使用“多智能体系统”(Multi-Agent Systems)。你可以把这想象成不是一个学生在孤军奋战,而是一个学习小组。你有一个“读者”负责阅读问题,一个“规划者”负责制定策略,一个“求解者”负责做数学题,还有一个“验证者”负责检查工作。他们按照特定的顺序传递笔记。

然而,这里有一个陷阱。如果让这个学习小组肆意妄为,他们可能会浪费大量的的时间和精力(计算能力)去争论一些已经错误的想法。这就像一群朋友试图解开一个谜团,但没有人停下来说:“等等,这个线索不合逻辑。”为了阻止这种浪费,研究人员使用了像“蒙特卡洛树搜索”(MCTS)这样的“搜索算法”。这就像是一位教练,他会说:“让我们尝试接下来的五个不同路径,看看哪一个看起来最有希望,然后我们就专注于那一个。”但是,大问题在于:教练如何知道哪条路径是有希望的呢?通常情况下,教练只有在看到最终答案正确或错误时,才知道结果。这项研究介绍了一个新工具,可以帮助教练在比赛的中途做出更好的决策。

论文:MASPRM

来自不列颠哥伦比亚大学和华为的研究人员正在解决正是这样一个问题。他们创建了名为 MASPRM(多智能体系统过程奖励模型)的东西。你可以把 MASPRM 想象成一个“超级教练”或“过程评判员”,它不仅仅是等待最终答案出来后才看小组是否成功,而是会在学习小组交谈的过程中实时观察,并为他们传递给彼此的每一条笔记进行评分。

在过去,如果一个 AI 团队在第 3 步犯了错,系统直到最后看到最终答案错误时才会察觉。到那时,AI 已经浪费了大量的能量去探索那条错误的路径。MASPRм 改变了游戏规则。它观察“路由转录本”(routed transcript)——这只是一个术语,指的是智能体之间发送的消息的有序列表。它对这些消息进行评分,例如:“嘿,规划者的这条特定消息是个好主意,让我们继续下去,”或者“求解者的这条消息正带我们走向死胡同,让我们立即切断这个分支。”

他们是如何教导教练的

这篇论文中最酷的部分之一是他们如何训练这个“超级教练”。通常,要教会计算机判断步骤,你需要一个人类坐在那里,将每一个步骤标记为“好”或“坏”,这非常昂贵且缓慢。作者发现了一个聪明的捷径。他们让 AI 智能体使用一种叫做 MCTS 的搜索方法进行数千次模拟运行。在这些模拟中,智能体会探索许多不同的路径。在每条路径的末尾,他们知道答案是正确(+1)还是错误(-1)。

然后,他们使用了一种数学技巧——“反向传播”(backpropagation)。想象一棵树,叶子是最终的结果。如果一个叶子是“胜利”,那么这个胜利的价值就会回传到之前的分支,使早期的步骤看起来更有价值。如果一个叶子是“失败”,那么价值就会作为负值回传。MASPRM 仅仅通过观察对话历史,就能学会预测这些价值,而无需任何人类亲口说出“这一步很好”。它学会了仅仅通过观察哪些对话最终会导致正确答案,就能分辨出哪些是充满希望的对话,哪些是死胡同式的争论。

他们的发现

团队在四个著名的基准测试上测试了这个新教练:用于数学问题的 GSM8K 和 MATH,以及用于通用知识和逻辑的 MMLU 和 LOGIQA。他们将 MASPRM 与另外两种方法进行了比较:

  1. 策略似然度(Policy Likelihood): 这就像 AI 只是在猜测,“我觉得下一个词可能是这个”,而没有真正的目标理解。
  2. ORM(结果奖励模型): 这是旧式的教练,它只检查最终答案,忽略中间的步骤。

结果非常明确。当研究人员使用 MASPRM 来引导搜索(具体使用的是 MCTS 和一种称为“步级束搜索”的方法)时,AI 解决问题的成功率显著提高。

  • 在 15 亿参数模型(较小、较快的 AI)上,MASPRM 比旧的结果奖励模型(ORM)提高了 2.0 到 3.0 个百分点
  • 在 70 亿参数模型(较大、更聪明的 AI)上,提升非常巨大,跳升了 4.1 到 14.5 个百分点
  • 在最难的测试(GSM8K)中,7B 模型与 MASPRM 的结合达到了 82.9% 的 Hit@1,这意味着它在第一次尝试时就能正确回答近 83% 的问题。

论文指出,MASPRM 特别擅长“逐步搜索”(stepwise search)。这是指 AI 必须做出一系列决策,比如选择下一个应该由谁发言,或者下一句话应该是什么。因为 MASPRM 可以判断这些中间步骤,它可以防止 AI 在错误的念头上浪费时间。它还让 AI 的选择变得更加可靠;“最佳”猜测与“第五最佳”猜测之间的差距缩小了,这意味着 AI 对其顶级选择更有信心。

局限性与未来

作者谨慎地指出,这并不是解决一切问题的万能药。他们的系统在智能体拥有固定调度(例如严格的发言顺序)且最终答案可以被清晰检查(例如带有特定数字的数学题)时效果最好。他们承认,对于没有单一正确答案的开放式任务,或者对于智能体角色会动态变化的系统,这种方法仍处于探索阶段。他们还发现,如果教练只能看到一个智能体所见的内容(而不是整个小组的对话),效果就不会那么好,这表明拥有一个“全局视角”对于团队聊天实现最佳表现至关重要。

简而言之,MASPRM 是在教导 AI 团队如何进行实时自我纠错方面的突破。与其等到结束时才意识到自己错了,它们现在拥有了一个能够及早发现错误路径并引导团队重回正轨的教练,从而节省了时间并取得了更好的结果。这表明,对于复杂的推理任务,秘诀不仅在于拥有更大的大脑,还在于拥有一种更好的方式来引导正在发生的思考过程。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →