← 最新论文
💻 computer science

A New Evolutionary Strategy: Learn From the Best

本文介绍了一种名为“向最优者学习进化策略”(Learn From the Best Evolution Strategy, LFB-ES)的新型黑盒优化器,它通过迭代地引导种群向精英个体学习,从而增强了高维神经网络的训练,并实现了比 OpenAI-ES 和 CMA-ES 等经典方法更优越的收敛性和准确性。

原作者: Zhijian Mo, Qihua Xiao, Zhihui Shan, Xueli Ban

发布于 2026-08-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhijian Mo, Qihua Xiao, Zhihui Shan, Xueli Ban

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能的广袤领域中,存在着一种连最先进的学习系统也会感到困惑的特定类型的谜题。想象一下,你要教一个机器人走路,或者让一个计算机程序预测复杂的天气模式,但你被禁止在过程中提供任何提示。你不能告诉它:“你的左脚抬得太高了”或者“你对周二的预测稍微偏离了一点”。你只能等到任务结束时,给它一个单一的数字:一个分数。这被称为具有稀疏奖励的黑盒优化问题。系统必须仅根据这个最终成绩来弄清楚如何改进其内部设置,而没有任何分步反馈。这种场景在现实世界的工程领域非常普遍,从调整新发动机的参数到将数学曲线拟合到带有噪声的数据中,然而它仍然是最困难的挑战之一,因为改进的路径是不可见的。

多年来,科学家们一直依靠进化策略来解决这些谜题。这些方法模仿自然选择:它们创建一群数字智能体,每个智能体的内部设置略有不同,让它们尝试执行任务,并保留那些获得最高分的个体。其中最著名的两种方法是 OpenAI-ES 和 CMA-ES,它们一直是这项工作的标准工具。然而,当任务变得高度复杂且需要调整的设置数量增加时,它们往往会陷入局部循环,移动缓慢,并且无法捕捉到问题的精细细节,就像一个在茂密森林中徘徊的徒步旅行者,一直在同一个小空地上打转,而不是寻找山峰。

来自联想(Lenovo)的一个研究小组提出了一种名为“从最佳进化策略中学习”(Learn From the Best Evolution Strategy,简称 LFB-ES)的新途径。LFB-ES 不再依赖于靠随机运气撞大运来发现更好的解决方案,而是引入了一种在种群内部的结构化学习形式。在实验的每一代中,表现最好的单个智能体会被选为“教师”。其余的群体则作为“学生”,去学习教师的行为。他们不仅仅是复制教师的最终得分;他们还试图模仿教师在任务过程中产生的特定动作序列和输出。通过使用一种数学过程来最小化他们自己的输出与教师输出之间的差异,学生们能够迅速调整其内部设置,使其表现得更像获胜者。这创造了一个循环,使种群能够集体向更好的解决方案攀升,由当前的冠军引导,而非盲目徘徊。

研究人员在一次困难的曲线拟合挑战中测试了这种方法。他们要求算法预测一种高度复杂、快速振荡的波形模式,这项任务需要捕捉数千个微小的波峰和波谷。算法接收到的唯一信息是整个预测运行结束时的总误差。结果令人瞩目。新的 LFB-ES 方法比传统方法收敛得更快,并达到了其他方法无法达到的精度水平。当旧的算法产生平坦且不准确的线条,从而错失了波形的复杂细节时,新方法几乎完美地匹配了真实数据,精准地重现了复杂的模式。

这一成功的关键部分在于计算机处理信息时使用的内部“开关”,即激活函数。研究人员发现,一种类似于正弦波起伏的周期性重复开关,比大多数现代 AI 使用的标准开关效果要好得多。当他们在新的学习框架内将标准开关更换为这种重复的周期性类型时,系统的探索能力和寻找最优解的能力得到了显著提升。然而,他们也发现这种优势并非普适的。当他们将同样的方法应用于涉及离散选择的不同类型问题时(例如智能体必须在左右移动之间做出选择的视频游戏),新方法并没有表现出同样的压倒性优势。它的表现略优于旧的随机方法,但并未像在连续曲线拟合任务中那样占据统治地位。

该研究还考察了这种新方法的成本。由于该方法需要学生智能体通过一系列计算向教师学习,因此它比最简单的随机方法运行时间更长。然而,研究人员表明,这种额外的时间是在可控范围内的,并且即使在需要调整的设置数量增加时,其扩展性也表现良好。相比之下,一种较旧的、更复杂的方法在处理大型问题时变得无法运行,因为它耗尽了计算机内存。新策略提供了一个折中方案:它比最简单的随机搜索更耗费计算资源,但比那些沉重且耗费内存的替代方案更高效且更有能力,使其成为解决仅在最终得分可用情况下的高维问题的实用工具。

最终,这项工作证明了,即使在一个没有任何中间指导的完全封闭的环境中,如果允许种群向其表现最佳的个体学习,它们也能实现快速改进。通过将这种社会学习动态与正确的数学工具相结合,研究人员创造了一个比以往更清晰、更快速地穿越黑盒优化迷雾的系统。虽然该方法并非解决所有类型问题的万能钥匙,但它为那些需要在不知道游戏内部规则的情况下调整复杂系统的工程师和科学家提供了一个强大的新工具。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →