想象一下,你正在尝试教导一个非常聪明但缺乏经验的机器人如何解决复杂的谜题。你有两种主要方法:
- 老方法(人工策划):你找到成千上万个现有的谜题,将它们记录下来,并希望机器人从中学习。问题在于,足够好的谜题数量不足,而且你拥有的那些可能太简单,或者彼此过于相似。
- “让它更难”的方法(当前的人工智能方法):你要求一个超级智能的人工智能通过说“让这个变得更难”来发明新的谜题。但人工智能往往只是做出微小且无意义的更改(例如将数字从 5 改为 6),或者一遍又一遍地重复相同的谜题。机器人感到无聊,并没有真正变得更聪明。
EVOTD(进化式任务发现) 是由佐治亚理工学院的研究人员提出的一种新方法,旨在解决这一问题。他们不再仅仅要求人工智能“让它更难”,而是将训练谜题的创建过程视为培育一个新物种的植物。
以下是其工作原理,使用简单的类比说明:
1. 两种要素:“食谱”和“份量”
研究人员意识到,每个谜题都有两个截然不同的部分:
- 技能(食谱):这是核心逻辑,例如知道如何使用“滑动窗口”或“二分查找”。它是所需的思维类型。
- 复杂度(份量):这是特定实例的大小或难度。数字列表是 5 项长还是 5,000 项?树是 3 层深还是 100 层?
大多数以前的方法试图同时随机改变这两者。EVOTD 将它们分开,就像一位厨师首先决定做什么菜(技能),然后决定为多少人服务(复杂度)。
2. 进化厨房
该系统使用两位特殊的“厨师”(算子)来创建新谜题:
- 变异器(份量厨师):这位厨师接受一个有效的谜题,并改变其规模或约束,而不改变核心逻辑。
- 类比:如果原始谜题是“在一排 10 人中找出最高的人”,变异器将其改为“在一排 10,000 人中找出最高的人”。逻辑(寻找最大值)保持不变,但难度(规模)增加了。这迫使机器人学习一个适用于任何规模的稳健规则,而不仅仅是小规模的示例。
- 杂交器(食谱厨师):这位厨师将两个不同的谜题结合起来,融合它们的核心技能,创造出全新的东西。
- 类比:如果谜题 A 使用“排序”,而谜题 B 使用“图遍历”,杂交器就会创建一个新谜题,要求你先对物品进行排序,然后才能遍历图。这就像混合巧克力和花生酱,创造出一种两者之前都不具备的新口味。这确保了机器人学会组合不同的逻辑工具。
3. “金发姑娘”过滤器(最近发展区)
你不能随意向机器人抛出随机谜题。如果谜题太简单,它学不到任何东西;如果它不可能完成,机器人就会放弃。
EVOTD 使用金发姑娘过滤器。在谜题用于训练之前,系统会检查:
- 是否太简单?(扔掉它)。
- 是否不可能完成?(扔掉它)。
- 是否刚刚好?(保留它!)。
关键在于,“刚刚好”会随着机器人变得更聪明而改变。昨天不可能完成的谜题,今天可能变得“刚刚好”。这创造了一个动态课程,随着机器人的进步自动变得更难,始终将其保持在“学习区”内。
4. 结果
研究人员在解决数学和编程问题的模型上测试了这种方法。他们发现:
- 更好的泛化能力:模型不仅仅是死记硬背答案;它们如此深入地掌握了底层逻辑,以至于能够解决它们从未见过的难题。
- 没有“同质化崩溃”:与其他最终耗尽创意并重复相同谜题的方法不同,EVOTD 持续发现新鲜、多样的挑战。
- 普遍提升:它在不同类型的 AI 模型上表现良好,无论其规模大小或原始训练方式如何。
总结
EVOTD 就像一位大师级教师,他不仅仅是分发练习卷。相反,他拥有一套系统化的方法,通过混合不同的逻辑技能并针对学生当前的能力完美调整难度,来发明新问题。这确保了学生始终受到恰到好处的挑战以促进成长,从而获得比仅仅在静态、预先写好的问题上练习更强的推理能力。
技术摘要:进化式任务发现(EVOTD)
问题陈述
大型语言模型(LLM)的推理能力通过“基于可验证奖励的强化学习”(RLVR)等后训练范式取得了显著进步。然而,这些方法的有效性从根本上受到可用训练数据的多样性和复杂性的制约。虽然数据合成提供了应对人类策划的推理任务稀缺性的解决方案,但依赖非结构化变异(例如,提示 LLM“使此任务更难”)的现有方法往往遭受同质性崩溃。这些方法通常生成近乎重复的样本,或未能系统地拓展推理前沿,因为它们将文本多样性与算法多样性混为一谈。此外,现有的基于技能的分类法往往关注问题的逻辑(即技能),却忽视了结构约束(即复杂度),导致产生“扁平化”的课程,无法在不同规模下诱导稳健的泛化能力。
方法论:进化式任务发现(EVOTD)
为了克服这些局限,作者提出了EVOTD,这是一个将数据合成视为在结构化双轴流形上进行定向搜索的框架。其核心创新在于将推理任务解耦为两个正交维度:
- 算法技能(S): 任务的语义逻辑骨干(例如,二分查找、动态规划、图遍历)。
- 复杂度属性(C): 决定问题实例量级的参数化结构约束(例如,输入规模、树深度、数值范围)。
进化引擎
EVOTD 采用“提议者 - 求解者”范式,其中“提议者”LLM 合成任务,“求解者”LLM 通过 RLVR 从中学习。合成过程利用两个结构化进化算子来遍历任务空间:
- 属性变异(垂直进化): 该算子在严格保持逻辑骨干不变的情况下扩展复杂度属性。提议者执行元认知审计以选择适用的属性(例如,仅针对基于树的任务增加
tree_depth),并对其进行强化,而非进行随机的文本扰动。这促使模型学习尺度不变的解决方案,而非脆弱的启发式规则。
- 技能交叉(水平进化): 该算子通过组合不同的算法模式来探索新颖的技能组合(例如,将
dijkstra 与 priority_queue 合并,或将 bitmask_dp 与 bfs 结合)。提议者被引导去寻找技能深度互联而非简单序列拼接的协同组合,从而防止组合退化。
动态课程筛选
EVOTD 的一个关键组件是**最近发展区(ZPD)**过滤器。为了确保任务具有教学有效性,框架在任务进入训练集之前验证三个条件:
- 可执行性: 代码必须无语法错误地运行,并在限制内终止。
- 技能对齐: 生成的任务必须严格遵循目标算法技能。
- 可学性: 任务对于当前的求解策略(πθ)既不能过于简单,也不能不可能完成。具体而言,求解器的通过率必须落在非平凡范围内(0<通过率<1)。随着求解器的改进,过滤器动态地将分布向更难的实例偏移,从而形成自适应课程。
主要贡献
本文形式化并展示了以下贡献:
- 双轴抽象: 将推理任务合成形式化为在算法技能与复杂度属性构成的流形上的定向遍历,超越了简单的提示工程,实现了对逻辑和约束的精确控制。
- 结构化进化算子: 引入了用于复杂度扩展的属性变异和用于组合发现的技能交叉,实现了对任务空间边界的系统性探索。
- 动态 ZPD 课程: 一种过滤机制,确保训练数据保持在模型的可学习区域内,从而在避免模式崩溃的同时促进推理能力的持续改进。
- 实证验证: 在五个基准测试(代码生成和数学推理)上进行了广泛评估,证明结构化进化课程优于启发式合成和自我改进基线。
实验结果
作者在多样的模型架构(Qwen3、LLaMA)、预训练模式(Base、Instruct)和参数规模(3B–8B)上评估了 EVOTD。
- 推理增益: 在 Qwen3-4B 推理模型上,EVOTD 在竞争性基准测试中取得了显著增益,包括在 AIME 24 上提升 +8.2%,在 AIME 25 上提升 +7.2%。
- 泛化能力: 该方法在所有评估的骨干网络上始终优于基线(包括 Evol-Instruct、SPIRAL 和 Agent0)。值得注意的是,它在所有测试架构上均取得了最佳的 Pass@1 性能。
- 对同质性崩溃的鲁棒性: 与通常会在提升 Pass@1 的同时降低 Pass@k(表明模式崩溃)的标准合成方法不同,EVOTD 在 Pass@1 和 Pass@8 上均表现出一致的增益,表明其促进了多样化的推理轨迹。
- 难度扩展: EVOTD 与基线之间的性能差距随着问题难度的增加而扩大,在 LiveCodeBench 等基准的“困难”子集上观察到了最大的相对增益(高达 90%)。这证实了复杂度调制在教授尺度不变逻辑方面的有效性。
- 通用领域迁移: 改进成果干净地迁移到了通用领域推理基准(MMLU-Pro、SuperGPQA),其中最显著的增益集中在 STEM 相关学科,这些领域对严谨推理有着严格的约束。
意义与主张
本文主张,EVOTD 通过从不受约束的启发式生成转向结构化进化搜索,确立了推理改进的新范式。作者认为:
- 结构优于随机性: 系统地将逻辑与复杂度解耦,能够生成启发式提示无法实现的高质量、多样化课程。
- 可扩展性且无过高成本: EVOTD 提供了一条务实的推理增强路径,使基础模型能够高效扩展,而无需复杂自博弈或工具集成框架所带来的高昂计算开销。
- 可解释性: 通过在透明的技能 - 复杂度流形上进化任务,该框架构建了一个既追求前沿又具有可解释性的课程,解决了许多自我改进 LLM 系统的“黑盒”性质。
作者得出结论,与标准提示中常见的非结构化生成相比,结构化进化为复杂推理提供了更为可靠的训练信号,有效地推动了 LLM 的推理前沿。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。