Learning Globally Reusable Skills for Coding Agents
该论文提出了 GSE,一种全局化的技能演化框架,该框架利用技能关系图和基于簇的整合来克服局部更新的局限性,使大语言模型编程智能体能够在无需昂贵重训练的情况下,持续提升其在多样化软件工程任务中的泛化能力与兼容性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一个超级聪明的机器人助手,它仅凭对话就能编写计算机代码、修复漏洞并构建软件。这个机器人由“大语言模型”(LLM)驱动,这就像一个巨大的数字大脑,阅读了互联网上的几乎所有内容。但问题在于:尽管这个大脑规模宏大,但它并不了解每一项具体工作的细节。这就像一个博学多才的学生,虽然掌握了驾驶理论,却从未真正驾驶过雪山上的卡车。为了提供帮助,我们给了机器人一本“技能书”——一份当它遇到困难时可以提取的指令和技巧清单。
核心问题在于:我们如何让机器人随着时间的推移变得更好,而不需要从头开始重建它的整个大脑?通常,当机器人犯错时,我们可能会尝试教它一个针对该特定错误的新技巧。但如果这个新技巧意外地破坏了它原本已经掌握的一个旧技巧怎么办?或者,如果机器人学到的一个技巧在某个项目中表现完美,但在下一个项目中却彻底失败了怎么办?这就是“技能进化”的难题:我们如何帮助机器人持续学习新技能,同时确保所有的技能都能像运转良好的机器一样协同工作?
问题所在:在真空状态下学习
认识一下 GSE(全局化技能进化),这是由研究员 Chen Yang 及其团队提出的新框架。要理解为什么 GSE 特别,请想象一个学生正在学习如何烘焙。如果每当烤焦一个巧克力蛋糕时,他们都试图学习一个新的食谱,他们最终可能会得到一个充满冲突指令的厨房。一张纸条说“加糖”,另一张说“不要加糖”,第三张说“只能在周二烘焙”。如果学生只是把这些纸条堆进抽屉(一个“技能库”),他们最终会感到困惑,并烤出一个灾难性的作品。
目前大多数教授 AI 智能体的方法都像这个混乱的抽屉一样工作。当 AI 失败时,它会创建一个新的技能来修复那个特定的失败。但它将每个新技能视为一个孤立的更新。它不会询问:“嘿,这个新规则是否与我昨天学到的规则相冲突?”或者“这个新技巧是否只是一个只适用于这一种特定蛋糕的奇怪巧合?”其结果是,机器人虽然擅长修复某一个特定的漏洞,但由于其“技能抽屉”充满了矛盾和过度专业化的技巧,它在其他所有事情上的表现都会变差。
解决方案:大师规划者与集体拥抱
研究人员提出了 GSE,它充当了机器人技能的“大师规划者”和“集体拥抱”。GSE 不仅仅是将新笔记丢进抽屉,而是利用两个聪明的工具来组织整个技能库。
首先,它构建了一个技能关系图(SRG)。你可以把它想象成一张巨大的、活生生的地图,将每一个技能与其他所有技能连接起来。它知道“技能 A”(比如检查烤箱温度)依赖于“技能 B”(比如预热烤箱)。如果机器人学习了一种新的检查温度的方法,地图会立即检查:“等等,这种新方法是否破坏了预热规则?”如果确实如此,GSE 不仅仅是添加新技能;它还会更新地图并调整相关的技能,以确保它们仍然能够协调一致。它将机器人的知识视为一个相互关联的生态系统,而不是一堆随机的事实。
其次,GSE 使用了基于簇的整合(Cluster-Based Consolidation)。想象一下,机器人尝试修复 100 个不同的漏洞。其中 10 个漏洞是因为机器人忘记检查文件是否存在。普通系统会写下 100 份不同的笔记,分别写着“检查文件 X”、“检查文件 Y”、“检查文件 Z”。然而,GSE 会观察所有 100 份笔记,发现其中的模式,然后说:“啊,你不需要 100 份笔记。你只需要一条总规则:‘在打开文件之前,务必检查文件是否存在。’”它将相似的错误组合在一起,并将它们转化为一个强大的、可重复使用的技能。这阻止了机器人去死记硬背每一个细微的错误细节,而是帮助它学习“通用的教训”。
最后,在任何新技能被添加到机器人的永久记忆之前,GSE 会通过**基于重放的验证(Replay-Driven Verification)**对其进行测试。这就像是一场彩排。机器人会在旧的、过去的问题上尝试新技能,以确保它不会意外地破坏以前做得很好的事情。如果新技能导致了“退化”(即倒退),它就会被丢弃。只有通过了这项严格测试的技能才能留下。
结果:更聪明,而不只是更努力
研究人员在两个现实世界的软件工程任务上测试了 GSE:生成测试以发现漏洞,以及过滤掉漏洞报告中的误报。他们将 GSE 与没有技能的机器人、由人类编写技能的机器人以及使用其他“学习”方法的机器人进行了对比。
结果令人印象深刻。在寻找漏洞的任务中,GSE 帮助机器人变得更加准确。例如,在一个机器人(OpenHands)上,与其它方法相比,GSE 将发现真实漏洞的能力(召回率)提高了高达 180.0%,同时也让机器人的精确度(精确率)提升了 6.1% 至 34.1%。在过滤误报的任务中,GSE 将精确率提高了 15.4% 至 96.4%,将召回率提高了 13.1% 至 19.8%。
研究还观察了一台由大型科技公司使用的现实工业机器人。尽管这台机器人已经相当聪明,但加入 GSE 后,其整体成功得分(F1 分数)提升了 61.4%。这表明 GSE 不仅仅是一种适用于简单机器人的方法;即使是在先进系统中,它也同样有效。
这意味着什么
论文明确反对了这样一种观点,即我们可以不断向机器人的大脑添加孤立的、局部的更新。他们表明,如果没有全局视角,这些更新会堆积起来,并最终让机器人变得更糟。他们还表明,仅仅复制人类编写的技能是不够的,因为人类无法为每一种可能出现的未来漏洞编写规则。
GSE 表明,AI 智能体的未来不仅仅是关于让它们在真空中变得更聪明,而是关于教它们如何组织自己的学习。通过绘制出技能之间如何相互关联的地图,并将相似的教训组合在一起,我们可以创造出能够持续进化且不会失去理智的机器人。研究人员通过对真实代码和工业数据的严格测试衡量了这些改进,这表明这种“全局化”的方法是迈向实现真正自主且可靠的 AI 智能体的重要一步。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。