← 最新论文
🤖 machine learning

Evolutionary Task Discovery: Advancing Reasoning Frontiers via Skill Composition and Complexity Scaling

本文提出了进化任务发现(EvoTD)框架,该框架通过将数据合成视为对技能组合与复杂度属性的定向搜索,利用结构化进化算子与动态难度过滤器,以克服数据同质性问题并实现稳健的泛化能力,从而增强大语言模型的推理能力。

原作者: Liqin Ye, Yanbin Yin, Michael Galarnyk, Yuzhao Heng, Sudheer Chava, Chao Zhang

发布于 2026-05-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Liqin Ye, Yanbin Yin, Michael Galarnyk, Yuzhao Heng, Sudheer Chava, Chao Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试教导一个非常聪明但缺乏经验的机器人如何解决复杂的谜题。你有两种主要方法:

  1. 老方法(人工策划):你找到成千上万个现有的谜题,将它们记录下来,并希望机器人从中学习。问题在于,足够好的谜题数量不足,而且你拥有的那些可能太简单,或者彼此过于相似。
  2. “让它更难”的方法(当前的人工智能方法):你要求一个超级智能的人工智能通过说“让这个变得更难”来发明新的谜题。但人工智能往往只是做出微小且无意义的更改(例如将数字从 5 改为 6),或者一遍又一遍地重复相同的谜题。机器人感到无聊,并没有真正变得更聪明。

EVOTD(进化式任务发现) 是由佐治亚理工学院的研究人员提出的一种新方法,旨在解决这一问题。他们不再仅仅要求人工智能“让它更难”,而是将训练谜题的创建过程视为培育一个新物种的植物

以下是其工作原理,使用简单的类比说明:

1. 两种要素:“食谱”和“份量”

研究人员意识到,每个谜题都有两个截然不同的部分:

  • 技能(食谱):这是核心逻辑,例如知道如何使用“滑动窗口”或“二分查找”。它是所需的思维类型
  • 复杂度(份量):这是特定实例的大小或难度。数字列表是 5 项长还是 5,000 项?树是 3 层深还是 100 层?

大多数以前的方法试图同时随机改变这两者。EVOTD 将它们分开,就像一位厨师首先决定做什么菜(技能),然后决定为多少人服务(复杂度)。

2. 进化厨房

该系统使用两位特殊的“厨师”(算子)来创建新谜题:

  • 变异器(份量厨师):这位厨师接受一个有效的谜题,并改变其规模约束,而不改变核心逻辑。
    • 类比:如果原始谜题是“在一排 10 人中找出最高的人”,变异器将其改为“在一排 10,000 人中找出最高的人”。逻辑(寻找最大值)保持不变,但难度(规模)增加了。这迫使机器人学习一个适用于任何规模的稳健规则,而不仅仅是小规模的示例。
  • 杂交器(食谱厨师):这位厨师将两个不同的谜题结合起来,融合它们的核心技能,创造出全新的东西。
    • 类比:如果谜题 A 使用“排序”,而谜题 B 使用“图遍历”,杂交器就会创建一个新谜题,要求你对物品进行排序然后才能遍历图。这就像混合巧克力和花生酱,创造出一种两者之前都不具备的新口味。这确保了机器人学会组合不同的逻辑工具。

3. “金发姑娘”过滤器(最近发展区)

你不能随意向机器人抛出随机谜题。如果谜题太简单,它学不到任何东西;如果它不可能完成,机器人就会放弃。

EVOTD 使用金发姑娘过滤器。在谜题用于训练之前,系统会检查:

  • 是否太简单?(扔掉它)。
  • 是否不可能完成?(扔掉它)。
  • 是否刚刚好?(保留它!)。

关键在于,“刚刚好”会随着机器人变得更聪明而改变。昨天不可能完成的谜题,今天可能变得“刚刚好”。这创造了一个动态课程,随着机器人的进步自动变得更难,始终将其保持在“学习区”内。

4. 结果

研究人员在解决数学和编程问题的模型上测试了这种方法。他们发现:

  • 更好的泛化能力:模型不仅仅是死记硬背答案;它们如此深入地掌握了底层逻辑,以至于能够解决它们从未见过的难题。
  • 没有“同质化崩溃”:与其他最终耗尽创意并重复相同谜题的方法不同,EVOTD 持续发现新鲜、多样的挑战。
  • 普遍提升:它在不同类型的 AI 模型上表现良好,无论其规模大小或原始训练方式如何。

总结

EVOTD 就像一位大师级教师,他不仅仅是分发练习卷。相反,他拥有一套系统化的方法,通过混合不同的逻辑技能并针对学生当前的能力完美调整难度,来发明新问题。这确保了学生始终受到恰到好处的挑战以促进成长,从而获得比仅仅在静态、预先写好的问题上练习更强的推理能力。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →