← 最新论文
🤖 AI

ESSAM: A Novel Competitive Evolution Strategies Approach to Reinforcement Learning for Memory Efficient LLMs Fine-Tuning

本文介绍了ESSAM,这是一种内存高效的全参数微调框架,它结合了进化策略与锐度感知最大化,在显著降低相比PPO和GRPO等传统强化学习方法所需的GPU内存占用的同时,实现了大语言模型上具有竞争力的数学推理性能。

原作者: Zhishen Sun, Sizhe Dang, Guang Dai, Haishan Ye

发布于 2026-05-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhishen Sun, Sizhe Dang, Guang Dai, Haishan Ye

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是论文《ESSAM:一种用于大语言模型高效微调的新型竞争进化策略强化学习方法》的通俗解释,辅以生动的类比。

核心难题:“沉重的背包”

想象你有一位才华横溢的学生(大语言模型,LLM),他擅长数学,但需要额外的辅导才能在解决棘手的应用题上表现出色。

通常,辅导这位学生的最佳方法是使用强化学习(RL)。你可以把 RL 想象成一位极其严格、高科技的教练,他观察学生的每一个动作,精确计算如何改进,并提供即时反馈。这种方法效果极佳,但有一个巨大的缺点:它需要一个巨大的“背包”(显存/GPU 内存)来承载所有计算。

对于一道标准的数学题,这个“背包”可能重如一辆小汽车(数百 GB)。大多数个人或小型实验室没有能背负这种重量的“汽车级”计算机,因此无法使用这种强大的辅导方法。

旧方案:“试错”团队

为了避开沉重的背包,研究人员尝试了一种名为**进化策略(ES)**的不同方法。

  • 工作原理:与其让一位严格的教练指导,不如想象有一支由 100 名探险家组成的团队。他们都从同一点出发,但每个人都走一条略有不同的随机路径(即“扰动”)。他们都尝试解决数学问题。那些得出正确答案的人获得“奖励”。团队随后观察获胜者,并说:“好吧,让我们都朝着获胜者前进的方向稍微移动一点。”
  • 优势:这种方法极其轻便。它不需要沉重的背包,因为它不进行复杂的反向计算。它只需要足以运行一次模型的内存(就像普通用户一样)。
  • 缺陷:虽然轻便,但探险家们经常被困在“浅谷”中。他们找到了一个勉强可行的解决方案,但不够稳健。如果你给他们一道稍有不同的数学题,他们可能会困惑。他们缺乏泛化能力(将所学应用到新情境的能力)。

新方案:ESSAM(“聪明的徒步者”)

作者提出了一种名为ESSAM(基于锐度感知的最大进化策略)的新方法。他们希望保留“试错”团队的轻便背包,同时加入严格教练的“智慧”以提升效果。

以下是 ESSAM 的工作原理,使用徒步类比:

  1. “锐度”问题:想象探险家们正朝着顶峰(最佳答案)进发。有时,他们发现一座看似高耸的峰顶,实际上却是一块尖锐、嶙峋的岩石。如果风吹来(即遇到新的数学题),他们很容易跌落。这就是“尖锐极小值”。
  2. ESSAM 的诀窍:在团队决定朝特定方向移动之前,ESSAM 会派出一名侦察兵检查该方向周围的地形。
    • 侦察兵会问:“如果我们朝这个方向走,地面是平坦稳固的,还是像悬崖一样崎岖?”
    • 如果地面崎岖(尖锐),团队会稍微折返。他们会寻找地面平坦宽阔的方向(即“平坦极小值”)。
    • 平坦的峰顶更安全。即使风吹来或问题略有变化,团队也能稳坐顶峰。

从技术角度讲:ESSAM 在标准的“试错”方法基础上增加了一个“邻域探测”。它暂时将模型参数移动到附近的点,检查那里的奖励是否稳定,并利用该信息指导主要更新。这迫使模型寻找稳健的解决方案,而不仅仅是靠运气。

结果:轻如鸿毛,强如壮牛

该论文在名为GSM8K(小学应用题数据集)的热门数学数据集上测试了该方法。

  • 性能:ESSAM 的表现与那些沉重且消耗显存的强化学习方法(如 PPO 和 GRPO)一样好。事实上,在某些模型上,它的表现甚至更好。
  • 内存:这是最大的胜利。虽然传统方法需要数百 GB 的内存,但 ESSAM 使用的内存量与基本的“试错”方法一样微小。
    • 类比:如果旧方法需要一辆半挂卡车来运输设备,ESSAM 则能塞进一辆自行车
    • 数据:它比标准重型方法(PPO)少用18 倍的内存,比另一种流行方法(GRPO)少用10 倍的内存。
  • 泛化能力:当在未见过的数学题(不同数据集)上进行测试时,经过 ESSAM 训练的模型在解题能力上远胜于标准的“试错”模型。它们学会了数学的概念,而不仅仅是死记硬背特定答案。

“涡轮增压”版(ESSAM-F)

作者还创建了一个更快的版本,称为ESSAM-F

  • 工作原理:它在“检查”阶段使用规模更小的侦察兵团队。
  • 结果:它的运行速度比原始 ESSAM快两倍,同时保持相同的微小内存占用和几乎同样的高精度。

总结

这篇论文介绍了ESSAM,一种教导 AI 学习数学的新方法。它将“试错”方法的低成本智能稳定性检查(锐度感知最大化)相结合。

  • 以前:你必须在“高性能但沉重/昂贵”(RL)和“轻便/便宜但弱小”(标准 ES)之间做出选择。
  • 现在:有了 ESSAM,你既能获得重型方法的高性能,又能拥有简单方法的轻便/低成本足迹。它使得小型实验室和开源社区能够在无需超级计算机的情况下,训练出强大的数学推理 AI。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →