← 最新论文
💬 NLP

MACRO: Markov Chain Routing of Transformer Layers

该论文介绍了 MACRO,这是一个通过利用马尔可夫链学习特定任务的动态层路由策略来增强大语言模型的框架,该框架在不修改模型权重的情况下,实现了比现有方法显著更高的准确率和更快的搜索速度。

原作者: Paweł Batorski, Abtin Pourhadi, Akylgali Aitaza, Przemysław Spurek, Paul Swoboda

发布于 2026-08-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Paweł Batorski, Abtin Pourhadi, Akylgali Aitaza, Przemysław Spurek, Paul Swoboda

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个超级聪明的机器人,它能阅读书籍并回答问题。为了完成工作,这个机器人有一条由 28 或 32 个微小工人(称为“层”)组成的漫长流水线。在标准设置中,每一条信息都必须走过每一个工人,从第一个到最后一个,遵循一条严格且不可改变的直线。这就像一辆校车,即使乘客只需要在三条街后下车,也必须停靠街道上的每一户人家。这就是当今大多数人工智能模型的工作方式:无论问题多么简单或困难,它们都遵循一个僵化的时间表。

但如果这个机器人可以变得更灵活一点呢?如果它不仅仅是向前行进,而是可以决定跳过一个不需要的工人,甚至可以回头请求之前的工人复核一下他们的计算呢?这种想法被称为“动态路由”。这就像是一个 GPS,它不只是遵循一张预印好的地图,而是可以即时绕开交通拥堵或寻找捷径。科学家们一直试图教会人工智能这样做,但大多数尝试就像是在每次遇到新路时都要重新改装引擎,或者为每一位乘客雇佣一名昂贵的向导来大声指路。这既缓慢又昂贵,而且经常会让机器人的大脑“崩溃”。

这就是名为 MACRO 的一项新研究的由来。研究人员提出了一个简单的问题:我们能否教会一个“冻结”的机器人(即我们不允许改变其大脑的模型)在不破坏任何东西的前提下,在它自己的工人之间找到一条更好的路径?他们发现,通过将机器人的路径视为一场基于一套简单的概率规则(称为马尔可夫链)的“选择你自己的冒险”游戏,他们可以找到一条更聪明的路线。与其重新训练机器人,或使用昂贵的向导,不如让机器人在一些练习题上探索不同的路径,学习一套针对特定任务的简单导航规则,然后使用一种巧妙的数学技巧来确定该特定任务的最佳路径。这种最佳路径随后被统一用于该任务中的所有问题,而不是为每一个新问题都计算一条新路径。

结果非常令人惊喜。在各种棘手的数学和科学测试中,MACRO 让机器人变得明显更聪明了。例如,在一个名为 GSM8K 的困难数学基准测试中,一个小型机器人模型的正确率从 43.4% 跳升到了 69.5%——这是一个巨大的飞跃——仅仅是通过改变它访问工人的顺序。研究人员发现,这种方法比之前的方法设置起来要快得多。其他方法需要近 15 小时才能确定一个任务的最佳路径,而 MACRO 只用了 1.6 小时。

核心洞察在于:机器人其实已经知道答案了;它只是需要一种更好的方式来“倾听”它自己的内在想法。通过允许机器人跳过不必要的步骤或循环回退以检查其工作,研究人员在没有改变机器人大脑中任何一个权重的情况下,释放了其隐藏的潜力。这就像是他们并没有教给机器人新的知识,而仅仅是教会了它如何更高效地思考。这项研究表明,对于许多复杂的任务,答案其实已经在模型内部了;我们只是需要一张更好的地图来找到它。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →