Route, Communicate, and Reason: Gated Routing and Adaptive Depth for Efficient Multi-Agent Reasoning
本文介绍了 GRADE,这是一个采用学习型门控机制和一种新型无评论家训练算法的分层多智能体系统,用于动态优化智能体选择、推理深度和通信,从而在复杂基准测试中实现了优于现有基准模型的性能,并显著降低了活跃计算量。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在主持一场规模宏大、赌注极高的知识竞赛之夜。过去的老办法是雇佣一位超级天才,但他们太贵且反应太慢,你无法负担得起向他们请教每一个问题。接下来的想法是雇佣一整个专家团队,让每个人都回答每一个问题,然后投票选出最好的一个。但这就像为了问一句“2+2等于几?”就雇佣一整个体育场的人一样,简直是在浪费金钱和时间。
于是,GRADE(门控路由与自适应深度高效推理系统)登场了。这是来自印度理工学院德里分校(IIT Delhi)研究人员开发的一种新系统,它就像一位才华横溢、组织极其严密的领队。GRADE 不会在每个问题来临时都叫醒整个团队,而是使用四个微小而智能的“门控”来决定谁需要发言、对话应该深入到什么程度,以及何时停止浪费时间。
领队与四道门
把 GRADE 想象成一栋三层高的办公楼:
- 第 0 层是前台(编排器/Orchestrator)。
- 第 1 层有两个经理。
- 第 2 层是充满专业专家的地下室(子代理/Sub-Agents)。
当一个问题进来时,GRADE 不会直接向整栋楼大喊大叫。它使用四个学习到的“门控”来做出决策:
- 分配门(The Assignment Gate): 这个门会问:“谁真正知道答案?”如果问题关于数学,它就会唤醒数学专家;如果关于历史,它就召唤历史专家。它不会去打扰生物团队。
- 深度门(The Depth Gate): 这是一个“这题有多难?”的测量计。对于简单的问题(比如“2+2等于几?”),门控会说:“就在前台停下。”没必要去叫醒经理或去地下室。对于超级难的问题,它会把通往底层的门全部打开,直到专家层。
- 交叉阅读门(The Cross-Read Gate): 这是“茶歇规则”。有时,一位数学专家需要与一位物理专家交流才能解决棘手的难题。这个门决定了哪些配对可以进行交谈。研究发现,让所有人都和所有人交谈实际上会让情况变得更糟(就像一个混乱的食堂),但让大约一半的配对进行交流则是最佳平衡点。
- 剪枝门(The Prune Gate): 这是“过滤噪音”的过滤器。如果一位专家开始喋喋不休或者给出了无用的答案,这个门会在其答案被混入最终解决方案之前将其切断。
秘诀:共同学习
这个团队是如何协作得如此完美的?研究人员使用了一种名为 CoGRPO 的训练方法。想象一位教练,他不仅根据最终答案评分,还会观察整个团队的策略。如果团队答对了,参与该特定策略的所有人(开启的门、发言的专家)都会得到一次击掌鼓励;如果失败了,他们都会得到一次温柔的“再试一次”。
至关重要的是,论文反对使用单独的“评论家”(即第二个用来评判第一个 AI 的 AI)。研究人员发现,这个额外的评判者实际上会减慢速度并降低团队效率。相反,他们让团队根据自己在同一批次中表现出的优劣来进行自我评分。
结果:更聪明,而非更大
研究人员在一些最难的脑筋急转弯上测试了这个系统,例如数学问题 (GSM8K)、常识问题 (MMLUPro) 和科学问题 (GPQA)。
- 大胜: 在 MMLUPro (78.2% vs 73.4%) 和 GPQA 上,GRADE 显著超越了此前最强的团队(称为 Puppeteer),尽管 GRADE 仅使用了约 170 亿个活跃参数。而获胜的团队(Puppeteer)使用了约 280 亿个参数。这就像 GRADE 在背着更轻便背包的情况下赢得了比赛。
- 速度: 由于 GRADE 在处理简单问题时跳过了繁重的计算,它的速度更快。简单问题大约耗时 3.1 秒,而最难的问题最高耗时 11.4 秒。而旧的方法无论难度如何,统一耗时 13 秒。
- 唯一失利的地方: 在超级困难的数学竞赛 (AIME-2025) 中,那些传统的重量级选手仍以微弱优势获胜(27.2% vs 25.3%)。论文指出,这是因为这些特定问题需要一个单一的、庞大的大脑来维持长链条推理,而 GRADE 较小的专业化专家们在应对这种纯粹的深度需求时还无法完全跟上。
“热插拔”惊喜
还有一个非常酷的部分:研究人员展示了你可以在比赛中途更换掉一名专家(比如将一个本地计算机模型替换为云端模型),而不会破坏系统。
然而,他们证明了当你进行更换时,你必须使用一个“校准图谱”(一个微调工具)。如果你只是更换了专家而没有调整门控,系统就会崩溃,准确率会立即下降 18 个百分点。有了校准图谱,系统只需经过几个问题(有时仅需 3 或 4 个)就能恢复准确率。如果没有它,恢复过程会非常漫长,甚至永远无法恢复。
他们排除了什么
论文非常明确地指出了哪些做法是行不通的:
- 固定团队: 让相同数量的专家回答每个问题(无论是 1 个、2 个还是 5 个)效果都比让系统动态决定要差。
- 过度交流: 让每个专家都与其它所有专家交谈会损害性能。论文发现,让 50% 的配对进行交谈比 100% 更好。
- 单独的评论家: 使用另一个 AI 来评判团队的工作,其效果不如团队进行自我评分。
总结
GRADE 表明,AI 的未来不仅仅在于构建更大、更沉重的模型。而在于构建更聪明、更灵活的团队,让他们知道何时努力工作,何时休息。通过使用这四个门控来路由问题、控制深度并剪掉糟糕的想法,该系统在实现顶尖水平结果的同时,使用的计算能力不到其最强对手的一半。这不仅仅关乎拥有最大的大脑,更关乎拥有最好的领队。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。