← 最新论文
🤖 machine learning

ELMER: Evolutionary Language Model that Explores and Refines

本文介绍了 ELMER,一种利用经过直接偏好优化(Direct Preference Optimization)微调的 Qwen3-8B 来通过强度引导自然语言策略变异的进化语言模型,证明了在程序进化中,基于语言的表示形式相比传统的语法编辑度量指标,能提供更优越的行为校准能力和搜索效率。

原作者: Matthew Siper, Ahmed Khalifa, Julian Togelius

发布于 2026-08-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Matthew Siper, Ahmed Khalifa, Julian Togelius

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人玩电子游戏,但你没有给它摇杆,而是每次它犯错时都必须为它编写一套新的规则。这就是**程序进化(program evolution)**的世界——在这个领域中,科学家利用计算机通过进行微小的改变、进行测试并保留优胜者,来“培育”出更好的软件。长期以来,这个过程有点像在黑暗中投掷飞镖。科学家们可以判断一个新版本的代码是变好了还是变坏了,但他们无法控制代码究竟改变了“多少”。对代码中单个单词的微小调整可能会意外地让一个温和行走的机器人变成一个混乱、崩溃的废品;而一次大规模的重写可能又会让机器人的行为几乎毫无变化。研究人员一直在追问的一个大问题是:我们能否构建一个系统,它不仅理解应该改变“什么”,还理解要将机器人的行为移动“多远”,从而让我们能够精确地将其引导至目标?

这就是论文《ELMER:探索与精炼的进化语言模型》(ELMER: Evolutionary Language Model that Explores and Refines)所要解决的问题。研究人员 Matthew Siper、Ahmed Khalifa 和 Julian Togelius 构建了一个巧妙的新系统,该系统使用大型语言模型(一种理解人类语言的超级智能 AI)来充当“变异算子”。该 AI 不是盲目地编辑计算机代码,而是编辑一段关于交易策略的自然语言描述——就像一份买卖股票的食谱。该 AI 接受了三种特定任务的训练:将食谱翻译成代码,将代码翻译回食谱,以及最重要的一点,根据“强度”指令对食谱进行变异。如果你告诉 AI 进行“低强度”改变,它会微调食谱;如果你说“高强度”,它就会重写整个内容。

团队在金融交易领域测试了这一方法,利用历史市场数据来观察新策略的表现。他们发现,通过训练 AI 去关注机器人实际行为的变化程度(即其“行为位移”),他们可以让“强度”指令发挥作用。当他们要求进行微小的改变时,AI 通常会做出微小的改动;当他们要求进行大幅度的改变时,它就会做出大幅度的改动。这意义重大,因为它将程序进化的混沌过程变得更像是驾驶汽车时的转向控制。论文表明,使用自然语言描述有助于 AI 比直接编辑原始代码做出更聪明、更受控的移动。在测试中,这种基于语言的系统找到了所有尝试方法中表现最好的交易策略,并且效率更高,能以更少的尝试达到良好的结果。虽然该系统并不完美且仍具有一定的随机性,但结果表明,教导 AI 用人类语言来“谈论”它的变化,为我们在浩如烟海的可能计算机程序空间中引导它提供了一种更好的方式。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →