← 最新论文
🤖 AI

ACEvo: Adversarial Co-Evolution of Problem Distributions and Solvers for Combinatorial Optimization

该论文介绍了 ACEvo,这是一个闭环框架,其中大语言模型通过协同演化启发式求解器与问题生成器,以创建自适应对抗课程,从而为组合优化产生更具鲁棒性的算法和更具挑战性的评估环境。

原作者: Ruibo Duan, Yuxin Liu, Haoran Ye, Xinyao Dong, Zhiqiang Xu, Chenglin Fan

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Ruibo Duan, Yuxin Liu, Haoran Ye, Xinyao Dong, Zhiqiang Xu, Chenglin Fan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个这样的世界:计算机的任务是解决那些最错综复杂、最混乱的谜题:比如计算一辆货车访问一千个停靠点时的最快路线、组织大规模的工厂调度,或是进行互联网中的数据路由。这些都是“组合优化”问题,其可能的答案数量之巨,以至于如果逐一检查,耗费的时间将比宇宙的年龄还要长。几十年来,人类一直在手工编写特殊的规则(称为“启发式算法”)来帮助计算机快速猜出最佳答案。但最近,我们开始教人工智能(特别是大语言模型,即 LLMs)为我们编写这些规则。一个核心问题是:如果我们只是用一组固定的练习题来教这些 AI 模型,它们真的足够聪明,能够应对现实世界中那些怪异且混乱的问题吗?还是说,它们仅仅是死记硬背了测试题,一旦遇到棘手情况就会失败?

这就是名为 ACEvo 的新研究发挥作用的地方。研究人员意识到,在静态且不变的问题集上训练 AI 求解器,就像是在让一名拳击手仅通过对着一个永远不会移动的沙袋进行对练来训练。拳击手可能变得擅长击打那个特定的沙袋,但他们学不会如何躲避一个真实且不可预测的对手。为了解决这个问题,团队创建了一个“闭环”系统,让 AI 不仅仅学习如何解决问题,还学习如何为自己创造越来越难的问题。这是一场数字军备竞赛,其中的“求解器”(问题解决者)和“生成器”(问题制造者)在不断尝试智斗对方。生成器制造出的谜题极其棘手,迫使求解器必须发明新的、更聪型的策略才能跟上节奏;而求解器变得如此强大,以至于生成器不得不发明更加扭曲的谜题。其结果是一个自我进化的循环,它产生了比以往任何时候都更难的挑战和更聪明的解决方案。

数字健身房:训练求解器与谜题制造者

在 ACEvo 的世界里,研究人员利用大语言模型搭建了一个独特的训练场。他们没有给 AI 一本静态的题目教科书,而是给了它两个在循环中同时执行的任务。

首先是求解器(Solver)。你可以把它想象成一名试图在迷宫中尽可能快地奔跑的运动员。求解器是一个 AI 程序,它通过编写代码来寻找穿过迷宫(或解决像旅行商问题这类路径规划问题)的最佳路径。

其次是生成器(Generator)。这是那位“邪恶天才”教练,负责设计迷宫。它的任务是观察求解器当前的技能水平,并构建一个专门旨在绊倒求解器的迷宫。如果求解器擅长跑直线,生成器就会建造一个充满尖锐、混乱转弯的迷宫。如果求解器变快了,生成器就会把墙壁加厚,把路径变得更加扭曲。

神奇之处在于协同进化(Co-Evolution)。在传统的训练中,问题是保持不变的。而在 ACEvo 中,生成器和求解器被锁定在一个反馈循环中。生成器创建一个批次的“困难实例”(超级复杂的题目)。求解器尝试解决这些问题。如果求解器失败或陷入挣扎,生成器就会收到信号:“嘿,这招奏效了!再多造一些类似的!”与此同时,求解器也会收到信号:“你在这里失败了;让我们重写你的策略来应对这种情况。”

这一过程是由**对抗性反馈(Adversarial Feedback)**驱动的。生成器并非只是在制造随机噪声;它在积极寻找求解器的弱点。它通过改变自身的代码来创造新的、更难的模式。随后,求解器通过改变自身的代码来修补这些漏洞。这是一个持续的“追逐与捕捉”的游戏,双方都在每一轮中变得更加强大。

结果:更难的谜题,更聪明的求解器

研究人员在三种经典的路径问题上测试了这个系统:旅行商问题(TSP)、定向问题(OP)和带容量限制的车辆路径问题(CVRP)。他们将 ACEvo 系统与使用标准、固定训练数据的其他顶尖 AI 方法进行了对比。

研究结果令人瞩目。当研究人员使用由 ACEvo 训练的求解器并在标准、著名的基准测试(如著名的 TSPLIB 数据集)上进行测试时,这些求解器的表现优于几乎所有其他方法,通常达到了近乎完美的得分。但真正的精彩之处在于 ACEvo 所创造的谜题难度。

当研究人员将标准的、预先存在的求解器(那些未使用 ACEvo 的求解器)放在 ACEvo 创建的新谜题上进行测试时,这些求解器崩溃了。它们的表现大幅下降,在某些任务中,“最优差距”(即他们的答案与完美答案之间的差距)上升到了 9% 或更多。相比之下,那些在 ACEvo 循环内接受过训练的求解器能够更好地处理这些超难谜题,保持了较低的差距。

例如,在针对具有 400 到 1,000 个城市的特定硬核 TSP 问题集上,经 ACEvo 训练的求解器始终优于竞争对手。当面对 ACEvo 生成的混沌局面时,其他方法的错误率飙升,而 ACEvo 求解器却能适应并保持敏锐。论文指出,这是因为 ACEvo 求解器不仅仅是记忆了一种模式,它学习到了一种能够处理生成器所发明的奇特、复杂结构的灵活策略。

为什么这很重要:算法的进化

该论文认为,这种“对抗性协同进化”是一个游戏规则的改变者。通过让 AI 设计自己的课程,ACEvo 创建了一个动态环境,迫使求解器不断进化。研究人员发现,如果你移除这个循环中的任何一部分——比如 AI 分析“为何失败”的“反思”步骤,或者尝试新代码的“变异”步骤——系统就无法像这样高效运作。求解器会陷入停滞,或者谜题的难度不足以推动其前进。

研究人员还对 ACEvo 创建的谜题进行了可视化处理。与看起来像随机散布在地图上的普通点阵不同,ACEvo 生成的问题具有奇异且复杂的结构。它们拥有紧密排列的点簇,或者看起来像螺旋形的蜿蜒路径。这些并非随机产生,而是被专门设计用来成为标准算法的“克里普特南特”(致命伤)。

最后,ACEvo 表明,解决复杂问题的未来不仅仅在于构建更好的 AI 模型,更在于构建更好的训练环境。通过让 AI 与一个不断进化的对手进行战斗,我们可以创造出鲁棒、适应性强且能够应对现实世界中不可预测挑战的算法。该论文并未声称已经解决了所有存在的优化问题,但它有力地表明,这种“军备竞赛”式的方法是一种强大的新途径,可以发现比我们亲手设计的算法更为强大的算法。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →