Hyper-ES: Effective Evolution Strategies for LLM Reasoning via Descent Direction Merging
Hyper-ES 是一个基于子空间的进化策略框架,它通过优化预计算梯度下降方向的逐层合并系数来增强大语言模型的推理能力,从而以比 GRPO-LoRA 等基于梯度的方法更少的资源实现更优越的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一个超级聪明的机器人如何解决棘手的数学问题。通常情况下,要教机器人,你必须展示成千上万个示例,并使用一种叫做“梯度下降”的过程来调整它整个大脑的每一个神经元。这就像是在通过同时调整每一个乐器的弦,来调音一整个庞大的管弦乐队。这种方法虽然有效,但它需要一台巨大的、昂贵的计算机,并且耗时很长。
最近,科学家们发现了一种不同的教机器人学习的方法,叫做“进化策略”(Evolution Strategies, ES)。与其仔细调整每一个神经元,你只需要对机器人的大脑进行成千上万次微小的随机改变,看看哪些改变能让它更擅长数学题,然后保留那些获胜的版本。这就像是在玩一场“热与冷”的游戏,你随机打乱机器人的大脑,直到它走运为止。问题在于,当机器人的大脑非常庞大(拥有数十亿个部分)时,随机打乱几乎注定会失败。这就像是在草堆里寻找一根特定的针,通过随机抓取一把把草的方式来寻找;你只会得到更多的草,而找不到针。这篇名为 HYPER-ES 的论文,试图通过在开始打乱之前给机器人一张更好的地图来解决这个问题。
问题所在:在草堆中迷失
本文的作者注意到,虽然进化策略在节省内存和计算能力方面表现出色,但在一个拥有数十亿参数的庞大大脑中寻找正确方向时却表现得很糟糕。如果你只是向一个巨大的模型投掷随机噪声,这些变化会变得非常混乱,要么互相抵消,要么将模型推向错误的方向。这就像试图通过从随机角度向一艘巨大的邮轮投掷石块来驾驶它;船只不会移动多少,甚至可能偏离你想要的方向。研究人员称之为“随机游走”问题,即模型会在无用的变化海洋中迷失方向。
解决方案:“下降方向”捷径
为了解决这个问题,HYPER-ES 背后的团队提出了一个巧妙的两步走策略。与其让机器人从零开始猜测正确的方向,他们首先要求它使用传统的、重型的法进行几次非常短暂、廉价的“练习赛”。
想象一下,你正在尝试寻找爬上山顶的最佳路线。与其在黑暗中盲目徘徊(随机打乱),你首先派出几架小型无人机,让它们向上爬行一小段距离,看看路径的坡度是如何变化的。这些无人机不需要爬完全部山路;它们只需要弄清楚哪个方向是“下坡”(即一个有用的方向)。HYPER-ES 方法正是如此:它运行几次快速、低成本的训练环节,以找到一些“下降方向”——基本上就是关于如何微调机器人的大脑使其变得更聪明的几个好主意。
魔法融合:混合最佳猜测
一旦有了这些好的方向,真正的魔法就开始了。与其让进化策略再次在整个拥有数十亿参数的大脑中进行搜索,不如让它只在一个由这些“好方向”组合而成的微小、紧凑的空间内进行搜索。
这就像一位厨师已经识别出了三种完美的食材(下降方向)。与其在整个杂货店寻找新食材,这位厨师利用进化策略来弄清楚如何完美地混合这三种食材。机器人会问:“如果我混合 30% 的方向 A、50% 的方向 B 和 20% 的方向 C,我会得到一个更好的数学求解器吗?”
该论文使用了一种名为 CMA-ES 的复杂算法来进行这种混合。这就像一位大师级厨师在品尝汤的味道并逐层调整香料,只不过这里调整的不是香料,而是调整有多少比例的“好方向”被添加到机器人的大脑中。这把对数十亿种可能性的搜索,转化成了对仅仅几百个数字的搜索,使其变得极其快速且高效。
研究发现
研究人员在三个不同的语言大模型(具体为 Qwen2.5 和 DeepSeek-R1)上测试了这种新方法,并让它们挑战六个不同的数学推理数据集,范围涵盖了从简单的算术到复杂的竞赛级数学问题。
结果令人振奋。HYPER-ES 的表现始终优于标准的“随机打乱”方法,甚至在准确率上略微超过了传统的重型训练方法(称为 GRPO-LoRA)。具体而言,新方法平均实现了约 1% 的准确率提升,同时使用了 10% 更少的昂贵计算机更新。
简单来说,HYPER-ES 通过采取一些聪明的捷径并精心混合这些捷径,而不是靠蛮力解决问题,成功地教会了机器人更好的数学能力。这表明,你不需要把整个厨房都搬出来解决问题;有时,找到几个好的方向并完美地混合它们,才是开启机器人推理能力的钥匙。论文表明,这种方法是一种稳定、节省内存的方式,可以提高 AI 的思考能力,尤其是在你没有超级计算机可以使用的时候。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。