← 最新论文
💬 NLP

Better, Faster, Stronger: Programmatic Skill Learning Best Reduces Agent Cost

本文认为,将技能表示为可执行程序是将大语言模型智能体适配新领域最具成本效益的策略,并通过所提出的“SpeedRunner”智能体证明,从过往轨迹中增量式学习并重构这些程序,能在保持跨多样化环境鲁棒性的同时显著降低成本。

原作者: Zixi Huang, Xiheng Wang, Andrew Wang, William Jurayj, Bernal Jiménez Gutiérrez, Daniel Khashabi, Nicholas Andrews

发布于 2026-08-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Zixi Huang, Xiheng Wang, Andrew Wang, William Jurayj, Bernal Jiménez Gutiérrez, Daniel Khashabi, Nicholas Andrews

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人如何在巨大的、杂乱的游乐场中导航。起初,这个机器人就像一个好奇的蹒跚学步的小孩:它尝试向前走,撞到了墙,感到困惑,再次尝试,然后可能学到了一点点东西。这就是现代 AI“智能体”(agents)通常的工作方式。它们是强大的语言模型,能够理解指令并与计算机对话,但当它们面对一个新的复杂任务时,往往必须从头开始“思考”每一个步骤。它们可能会尝试开门,失败了,然后尝试另一种方法,再次失败,然后不断循环直到成功。虽然这行得通,但既慢又贵。每当机器人“思考”一次,都会产生费用和时间成本,就像人类解决每一个谜题都要支付每一分钟的费用一样。

一个重大的问题是研究人员一直在问的:我们如何才能教这些机器人变得更好,而不需要让它们一遍又一遍地重复学习同样的事情?答案通常涉及“技能”(skills)。把技能想象成一种捷径或预先做好的食谱。你不需要每次都从零开始研究如何烤蛋糕,你只需要遵循一份你已经写好的食谱。有一段时间,科学家们尝试用纯英语来编写这些食谱。但本文的作者们在想:如果我们用代码来编写这些食谱呢?代码就像是一本超级精确的说明书,计算机可以立即遵循它,而不会感到困惑或浪费时间。这个大想法是,如果我们能将机器人的混乱试错经历转化为干净、可重用的代码,机器人可能会变得更快、更便宜、更聪明。

这正是“SpeedRunner”项目背后的团队想要测试的想法。他们想看看一个 AI 智能体是否能在工作的同时学习编写基于代码的技能,而不是仅仅被动地接受指令。他们构建了一个系统,让 AI 玩游戏、犯错,然后第二个特殊的“编码智能体”会观察机器人的历史记录。这个编码智能体就像是一个集侦探和程序员于一身的角色。它扫描机器人的过往尝试,寻找机器人不断失败或重复执行相同长序列步骤的模式,然后编写一段新的代码来修复它。这就像是在观看一段某人试图系鞋带的视频,意识到他们总是把鞋带弄卡住,然后写出一份完美的小型说明书,教如何正确系鞋带,从而确保再也不会卡住。

研究人员在三个非常不同的虚拟世界中测试了这个想法:一个需要混合化学物质的科学实验室,一个需要遵循指令捡拾物品的网格世界,以及一个需要收集资源并对抗僵尸的生存游戏。在所有这些地方,“SpeedRunner”智能体都学会了在运行过程中编写自己的代码技能。结果是令人瞩目的。当其他方法要么陷入循环,要么随着学习的深入变得越来越昂贵时,SpeedRunner 实际上在学习过程中变得越来越便宜且高效。它将长而复杂的动作序列转化成了短小、可重用的代码函数。例如,与其让机器人花费大量的钱去思考如何寻找一棵树,它学会了一个简单的代码命令叫做“find_tree”,它可以直接点击使用。

论文指出,这种方法是成本方面的游戏规则改变者。在其中一次测试中,SpeedRunner 智能体使用的资金(以计算处理能力衡量)大约只有标准方法解决相同问题所需资金的八分之一。它不仅节省了资金,而且还提高了完成任务的能力。关键在于,编码智能体不仅仅是记忆发生了什么,它还分析了“为什么”会失败。如果机器人因为看不见资源而反复失败,编码智能体就会编写一个“扫视区域”的新函数,而不是直接放弃。这使得智能体具有鲁棒性(robust),这意味着它可以处理环境中的随机变化,比如僵尸突然出现,而不会陷入恐慌。

然而,作者也谨慎地指出,这并不是适用于所有情况的灵丹妙药。他们发现,如果机器人已经非常擅长某项任务,强迫它使用代码可能会让它变得有些过于僵化,就像一个严格遵循食谱的机器人,如果烤箱坏了,它就无法适应。但对于大多数复杂的长期任务,将混乱的经历转化为干净的代码似乎是让 AI 智能体变得既聪明又经济的最佳方式。这项研究表明,通过让智能体在玩耍的过程中编写自己的“自动化捷径”,我们可以构建出能够高效学习的系统,而无需在每次面对新挑战时都从头开始重新训练。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →