VCE-Skill: Enhancing Skill Self-Evolution with Version-Change Experience
该论文提出了 VCE-Skill,这是一个通过将特定任务的执行轨迹与从公开技能版本历史中蒸馏出的结构化经验进行自适应融合,从而增强智能体技能自我进化的新颖框架,最终实现了显著的性能提升和更强的跨模型迁移能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人工智能飞速发展的世界里,研究人员正在教计算机程序表现得更像人类助手。这些程序通常被称为“智能体”(agents),它们不仅能回答问题,还能通过使用工具、遵循指令和管理文件来执行任务。为了让这些智能体更加可靠,开发者赋予了它们“技能”。可以将技能想象成一个便携式的工具箱,其中包含了一套指令、脚本和资源,智能体可以在遇到特定类型的难题时随时拿起并使用。然而,正如人类会从错误中学习一样,这些工具在最初创建时很少是完美的。随着世界的变化和新挑战的出现,这些工具箱内部的指令需要被更新、修补和改进。科学家们面临的核心问题是,如何实现这种改进过程的自动化,从而让智能体能够通过自我教学来实现自身的进化。
在一段时间内,这种自我改进的标准方法是让智能体尝试一项任务,观察它在哪里失败,然后根据那次特定的失败来重写指令。这种方法完全依赖于当前尝试过程中收集到的证据。虽然这行之有效,但它有一个盲点:它只能看到此时此刻发生的错误。它错失了其他开发者在多年维护类似工具过程中所学到的更广泛的教训。来自中国科学院和北京邮电大学的一个研究团队意识到,这种狭隘的关注点让大量的知识库处于闲置状态。他们试图探索,公开软件工具的变更历史是否能教会智能体一些其自身即时经验无法获得的东西。
研究人员首先对比了两种不同的信息来源。第一种来源是智能体近期尝试任务的过程,它提供了关于哪里出错的详细但狭窄的视角。第二种来源是人类开发者在一段时间内对类似工具进行的公开变更历史。当他们将这两类来源进行并排分析时,发现了一个清晰且有用的差异。智能体的尝试主要集中在修复调用工具或读取指令时的即时、特定错误。相比之下,公开历史包含了更广泛的改进内容,包括数据组织方式、脚本结构以及工具处理意外情况方式的变化。公开记录提供了更广阔的视角,而智能体自身的记录则提供了基于任务的现实基础。这两种来源并非重复,而是互补。
为了将这一洞察付诸实践,研究团队开发了一个名为 VCE-Skill 的新系统。该系统充当了智能体当前经验与过去集体智慧之间的桥梁。整个过程分为两个主要阶段。首先,系统会对来自公开仓库的原始、杂乱的变更历史进行清理。它会剥离掉仅适用于某个特定项目的细节,并将其提炼为通用的、可复用的教训。例如,如果许多开发者都添加了一个“在尝试打开文件前先检查文件是否存在”的步骤,系统会将此学习为一条通用规则,而非仅仅是一个单一的修复方案。这些提炼出的教训会被存储在一个结构化的经验库中。
在第二阶段,智能体会尝试一项任务,并根据发生的情况产生自己的改进想法。随后,系统会查看其提炼出的教训库,并选择与当前问题最相关的教训。它并不仅仅是简单地复制旧有的教训或忽略智能体自己的想法,而是仔细地将两者融合。如果智能体正挣扎于一个公开历史中曾多次解决过的常见问题,系统就会更多地借鉴这种外部智慧。如果智能体面临的是一个从未见过的独特且奇怪的错误,系统则会更信任智能体自身的观察。这种平衡并非固定不变的;系统会根据这些变化是否确实让智能体的表现有所提升,不断调整对外部库与智能体自身经验的信任权重。
研究人员在五种不同类型的任务上测试了这种方法的成果,涵盖了从回答复杂问题、管理电子表格到在虚拟环境中控制机器人等领域。研究人员使用了四种不同的语言大模型来充当智能体。在所有案例中,将这种外部经验加入智能体的自我改进循环后,其性能都得到了提升。智能体的平均得分更高,在各项测试中的提升幅度约为三到五分。更重要的是,使用这种方法进化的技能表现出了更强的鲁棒性(稳健性)。当研究人员将一个通过这种新方法进化的技能应用于与训练时不同的计算机模型时,其表现明显优于那些仅通过学习自身即时错误而进化的技能。这表明,通过纳入来自公开历史的更广泛教训,智能体学习到了可以应用于新情境的通用原则,而不仅仅是死记硬背如何修复特定的错误。
这项研究并不声称旧有的“从错误中学习”的方法是无用的。智能体自身的经验对于理解任务的具体细节仍然至关重要。新方法只是增加了一层智能体无法自行发现的上下文背景。通过将公开软件变更的历史视为一种宝贵的先验知识,研究人员证明了智能体可以更有效地进行进化。他们展示了:通往更聪明、更可靠智能体的路径,不仅在于观察当下的发生,还在于理解相似工具是如何随时间推移而不断改进的长篇故事。这种方法提供了一种让人工智能更具适应性的实用途径,确保其使用的工具不仅适用于今天,而且在未来也具备足够的稳健性。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。