← 最新论文
💬 NLP

MARS: Co-evolving Dual-System Deep Research via Multi-Agent Reinforcement Learning

本文介绍了 MARS,一种新颖的多智能体强化学习框架,它通过协同演化双重认知系统(快速直觉与深思熟虑的推理)来克服大语言推理模型在 Token 效率和知识局限性方面的不足,在无需监督微调的情况下,在知识密集型任务上实现了最先进的性能。

原作者: Guoxin Chen, Zile Qiao, Wenqing Wang, Donglei Yu, Xuanzhong Chen, Hao Sun, Minpeng Liao, Kai Fan, Yong Jiang, Penguin Xie, Wayne Xin Zhao, Ruihua Song, Fei Huang

发布于 2026-02-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Guoxin Chen, Zile Qiao, Wenqing Wang, Donglei Yu, Xuanzhong Chen, Hao Sun, Minpeng Liao, Kai Fan, Yong Jiang, Penguin Xie, Wayne Xin Zhao, Ruihua Song, Fei Huang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心问题:“过度思考者”与“过时”的图书馆

想象你有一个才华横溢、超级聪明的助手(AI),他非常擅长解决难题。然而,这个助手有两个主要的缺陷:

  1. 过度思考者: 当你要求他阅读一篇简单的文章或总结一个网页时,他有时会陷入“深度思考”模式。他会分析每一个字,在不需要深度分析的事情上浪费时间和精力。这就像是用大锤去砸坚果。
  2. 过时的图书馆: 这个助手的知识停留在他们接受训练的那一天。如果你问他关于昨天发生的事情,他会一窍不通。如果没有经过处理,面对海量的新信息,他会因为感到困惑而无法自行查找资料。

解决方案:MARS(双脑协作团队)

研究人员创建了一个名为 MARS 的新系统。他们没有试图用一个大脑去做所有事情,而是借鉴了人类大脑的工作方式,在同一个 AI 内部构建了一支由两个截然不同的“人格”组成的团队:

  • 系统 1(快速侦察兵): 这是“直觉型”大脑。它快速、高效且擅长扫描。它的任务是观察大量的新信息(比如 10 个不同的网页或研究论文),并迅速提取出最重要的事实。它就像一名在前线奔跑的侦察兵,只带走有用的补给,留下没用的垃圾。
  • 系统 2(深度思考者): 这是“深思熟虑型”大脑。它缓慢、谨慎,擅长解决复杂的逻辑谜题。它接收来自系统 1 的纯净、提炼后的事实,并利用这些事实来解决实际问题。

神奇之处在于:
在之前的系统中,“侦察兵”和“思考者”是分别进行训练的。侦察兵不知道思考者需要什么,因此它可能会总结一些思考者并不关心的内容,或者遗漏了思考者迫切需要的细节。

在 MARS 中,它们是协同进化的。它们一起训练。侦察兵学会了什么样的信息能帮助思考者解决谜题,而思考者也学会了如何向侦察兵索取正确的东西。它们共享同一个“分数”(奖励),因此它们是一个完美的团队,而不是两个陌生人。

他们是如何训练的:“团队游戏”

为了教会这两个系统在没有人类老师的情况下协作(这种方法被称为“零样本强化学习”,意味着它们从零开始,没有任何预先编写的示例),研究人员使用了一种基于**群体相对策略优化(GRPO)**的聪明训练游戏。

把它想象成一支体育队正在为冠军赛进行练习:

  1. 团队集结(装箱问题): 当团队外出收集信息时,他们可能会发现 10 个不同的网页。一次性阅读这么多内容太多了。该系统使用一种“装箱”策略(就像把杂乱的物品装进购物袋一样)。它将这些杂乱、大小不一的页面组织成整齐、易于处理的块,以便侦察兵可以同时阅读它们而不会感到应接不暇。
  2. 计分板(共享奖励): 团队外出尝试解决一个问题。如果他们答对了,侦察兵和思考者都会得到一分。如果失败了,谁也得不到分。这迫使他们必须合作。
  3. 公平竞争(解耦梯度): 这是最棘手的部分。尽管它们共享分数,但研究人员确保了侦察兵因“总结得好”而获得荣誉,而思考者因“推理得好”而获得荣誉。这就像一场接力赛:如果团队赢了,两名选手都会获得奖牌,但教练知道谁跑了第一棒,谁跑了第二棒。这确保了侦察兵学习的是如何成为更好的侦察兵,而不仅仅是成为更好的思考者。
  4. 平衡团队(平衡采样): 有时侦察兵需要阅读 5 页,有时只需要 1 页。这会导致训练数据的失衡。系统使用一种特殊的采样方法,以确保侦察兵和思考者获得相等的练习时间,从而防止其中一方主导学习过程。

结果:小团队,大胜利

研究人员在名为 HLE(人类最后考试) 的极难考试上测试了 MARS,该考试涵盖了科学、数学和历史等高级课题。

  • 挑战者: MARS 使用了一个相对较小的模型(80 亿参数)。
  • 巨头们: 他们将其与更大的模型(320 亿或 720 亿参数)以及一些来自大科技公司的昂贵的、专有的“超智能”模型进行了对比。
  • 结果: MARS 击败了那些经过人类示例预训练(监督微调)的更大模型。尽管从零开始且没有人类指导,且使用的是更小的“大脑”,它甚至非常接近目前最先进的商业模型的表现。

为什么这很重要(根据论文所述)

论文声称,秘诀不仅在于拥有更多的工具(如搜索引擎或计算器),而是在于伙伴关系

  • 没有“侦察兵”(系统 1),“思考者”(系统 2)会被过多的原始数据淹没并导致出错。
  • 没有“思考者”(系统 2),“侦察兵”(系统 1)只会进行总结,而无法解决实际问题。
  • 在一起时,它们创造了一个既能阅读海量最新信息,又能高效解决复杂多步推理问题的系统。

简而言之,MARS 教会了 AI 何时应该“快速扫描”,何时应该“深度思考”,以及如何将两者结合,而不至于产生混乱。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →