MARS: Co-evolving Dual-System Deep Research via Multi-Agent Reinforcement Learning
本文介绍了 MARS,一种新颖的多智能体强化学习框架,它通过协同演化双重认知系统(快速直觉与深思熟虑的推理)来克服大语言推理模型在 Token 效率和知识局限性方面的不足,在无需监督微调的情况下,在知识密集型任务上实现了最先进的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
核心问题:“过度思考者”与“过时”的图书馆
想象你有一个才华横溢、超级聪明的助手(AI),他非常擅长解决难题。然而,这个助手有两个主要的缺陷:
- 过度思考者: 当你要求他阅读一篇简单的文章或总结一个网页时,他有时会陷入“深度思考”模式。他会分析每一个字,在不需要深度分析的事情上浪费时间和精力。这就像是用大锤去砸坚果。
- 过时的图书馆: 这个助手的知识停留在他们接受训练的那一天。如果你问他关于昨天发生的事情,他会一窍不通。如果没有经过处理,面对海量的新信息,他会因为感到困惑而无法自行查找资料。
解决方案:MARS(双脑协作团队)
研究人员创建了一个名为 MARS 的新系统。他们没有试图用一个大脑去做所有事情,而是借鉴了人类大脑的工作方式,在同一个 AI 内部构建了一支由两个截然不同的“人格”组成的团队:
- 系统 1(快速侦察兵): 这是“直觉型”大脑。它快速、高效且擅长扫描。它的任务是观察大量的新信息(比如 10 个不同的网页或研究论文),并迅速提取出最重要的事实。它就像一名在前线奔跑的侦察兵,只带走有用的补给,留下没用的垃圾。
- 系统 2(深度思考者): 这是“深思熟虑型”大脑。它缓慢、谨慎,擅长解决复杂的逻辑谜题。它接收来自系统 1 的纯净、提炼后的事实,并利用这些事实来解决实际问题。
神奇之处在于:
在之前的系统中,“侦察兵”和“思考者”是分别进行训练的。侦察兵不知道思考者需要什么,因此它可能会总结一些思考者并不关心的内容,或者遗漏了思考者迫切需要的细节。
在 MARS 中,它们是协同进化的。它们一起训练。侦察兵学会了什么样的信息能帮助思考者解决谜题,而思考者也学会了如何向侦察兵索取正确的东西。它们共享同一个“分数”(奖励),因此它们是一个完美的团队,而不是两个陌生人。
他们是如何训练的:“团队游戏”
为了教会这两个系统在没有人类老师的情况下协作(这种方法被称为“零样本强化学习”,意味着它们从零开始,没有任何预先编写的示例),研究人员使用了一种基于**群体相对策略优化(GRPO)**的聪明训练游戏。
把它想象成一支体育队正在为冠军赛进行练习:
- 团队集结(装箱问题): 当团队外出收集信息时,他们可能会发现 10 个不同的网页。一次性阅读这么多内容太多了。该系统使用一种“装箱”策略(就像把杂乱的物品装进购物袋一样)。它将这些杂乱、大小不一的页面组织成整齐、易于处理的块,以便侦察兵可以同时阅读它们而不会感到应接不暇。
- 计分板(共享奖励): 团队外出尝试解决一个问题。如果他们答对了,侦察兵和思考者都会得到一分。如果失败了,谁也得不到分。这迫使他们必须合作。
- 公平竞争(解耦梯度): 这是最棘手的部分。尽管它们共享分数,但研究人员确保了侦察兵因“总结得好”而获得荣誉,而思考者因“推理得好”而获得荣誉。这就像一场接力赛:如果团队赢了,两名选手都会获得奖牌,但教练知道谁跑了第一棒,谁跑了第二棒。这确保了侦察兵学习的是如何成为更好的侦察兵,而不仅仅是成为更好的思考者。
- 平衡团队(平衡采样): 有时侦察兵需要阅读 5 页,有时只需要 1 页。这会导致训练数据的失衡。系统使用一种特殊的采样方法,以确保侦察兵和思考者获得相等的练习时间,从而防止其中一方主导学习过程。
结果:小团队,大胜利
研究人员在名为 HLE(人类最后考试) 的极难考试上测试了 MARS,该考试涵盖了科学、数学和历史等高级课题。
- 挑战者: MARS 使用了一个相对较小的模型(80 亿参数)。
- 巨头们: 他们将其与更大的模型(320 亿或 720 亿参数)以及一些来自大科技公司的昂贵的、专有的“超智能”模型进行了对比。
- 结果: MARS 击败了那些经过人类示例预训练(监督微调)的更大模型。尽管从零开始且没有人类指导,且使用的是更小的“大脑”,它甚至非常接近目前最先进的商业模型的表现。
为什么这很重要(根据论文所述)
论文声称,秘诀不仅在于拥有更多的工具(如搜索引擎或计算器),而是在于伙伴关系。
- 没有“侦察兵”(系统 1),“思考者”(系统 2)会被过多的原始数据淹没并导致出错。
- 没有“思考者”(系统 2),“侦察兵”(系统 1)只会进行总结,而无法解决实际问题。
- 在一起时,它们创造了一个既能阅读海量最新信息,又能高效解决复杂多步推理问题的系统。
简而言之,MARS 教会了 AI 何时应该“快速扫描”,何时应该“深度思考”,以及如何将两者结合,而不至于产生混乱。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。