Repo2Skill-Evo: Repository Skills Go Stale in Silence
本文表明,尽管将特定仓库的知识外部化为大语言模型(LLM)智能体技能可以提高性能,但这些技能会在软件发布期间发生无声的退化,甚至前沿智能体也难以在不引入显著覆盖率或精确度误差的情况下可靠地更新这些技能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代数字领域中,软件很少是一个静态的对象;它是一个不断变化的、有生命的实体。开发者每天都会发布新版本的程序,修复漏洞、添加功能并改变代码的工作方式。为了在这一不断变化的领域中穿行,被称为“智能体”(agents)的人工智能系统正越来越多地被使用。这些智能体就像数字助手一样,能够阅读代码、运行脚本并自行解决问题。然而,一个智能体若要在特定的软件项目上高效工作,它需要的不仅仅是通用智能;它需要一套针对该项目当前版本定制的特定指令。研究人员将这些定制化的指令称为“技能”(skills)。可以将一种技能想象成一本简洁且可重复使用的指南手册,它准确地告诉智能体在执行特定任务时应该按下哪些按钮以及打开哪些文件。正如人类机械师需要一份针对刚更换了新引擎的车型的最新手册一样,AI 智能体也需要在其管理的软件发生变化时更新其指南手册。
一个关键的问题是,当软件发生变化而指南手册却没有更新时,会发生什么?如果一个程序进行了更新,旧的指令可能会变得错误,但 AI 可能并未意识到这一点。它可能会继续遵循过时的指南,从而导致错误,却从未发出警报。这种知识变得在无声中失效的现象,正是名为 Repo2Skill-Evo 的一项新研究的研究重点。研究人员旨在观察当今最先进的 AI 智能体是否能够识别其内部指南手册何时变陈旧,并能否正确地更新它们。他们并没有将这些技能的维护视为一次性任务,而是将其视为一个持续性的挑战,这与软件本身的不断演进相呼应。
为了对此进行调查,研究人员收集了大量的现实世界软件项目,特别关注了 57 个经历了 105 次不同更新的仓库。对于每个项目,他们首先基于软件的旧版本创建了一套完美的“技能”集。这些技能经过精心设计以确保准确,作为基准。随后,他们引入了官方更新补丁——即把软件从旧版本转变为新版本的确切变更集。给予 AI 智能体的任务在理论上很简单,但在实践中却很难:观察旧的技能和新的变更,识别旧指南中哪些部分现在已经错误,删除或修复这些部分,并保留其他仍然有效的部分。研究人员不仅要求智能体尝试,还通过将最终结果与代表“应当如何变更”的金标准进行对比,精确测量了智能体的表现。
结果揭示了这些智能体的潜力与其处理变化能力的实际水平之间存在显著差距。即使是当今最先进的 AI 模型,在保持这些技能的时效性方面也显得力不从心。当研究人员评估六种领先的智能体时,表现最好的一个平均也只能在约 70% 的案例中正确识别并更新信息。其他的表现更差,有些甚至仅达到 30% 的准确率。这意味着在大多数情况下,智能体要么未能删除过时的指令,导致 AI 获得误导性建议,要么做得过头,删除了原本仍然正确的信息。研究发现,智能体经常遗漏需要关注的具体文件,或者编辑范围过大,将有效内容连同错误内容一并删除。
对智能体失败原因的深入分析显示了两个主要的瓶颈。首先,智能体经常无法定位指南手册中受软件更新影响的具体部分。这就像一位图书管理员知道一本书需要更新,却找不到出错的具体页面。其次,即使智能体找到了正确的位置,它们也往往难以决定究竟要修改什么。它们倾向于要么不对错误进行处理,要么重写大段文本,从而破坏了有用的信息。研究人员测试了仅仅告诉智能体应该查看哪些文件是否能解决问题。虽然这有所帮助,但并未完全解决问题;智能体在决定如何编辑这些文件内容时仍然会犯错。这表明,问题不仅在于寻找正确的位置,还在于理解“旧”与“新”之间细微的差别。
该研究还证实了这些技能确实具有价值。在测试维护能力之前,研究人员检查了拥有这些指南手册是否真的能帮助 AI 智能体更好地完成工作。他们发现,当智能体可以使用这些特定技能时,它们的表现得到了显著提升,尤其是在处理此前对软件知之甚少的任务时。这证明了这些技能不仅是一个理论概念,更是一个让 AI 智能体更有效的实用工具。然而,这些工具的价值完全取决于其准确性。如果指南手册过时了,它就会从资产变成负债,可能导致智能体犯下原本在从零开始工作时不会犯的错误。
研究人员得出结论,目前的这一代 AI 智能体无法被信任去维护其随着软件演进而不断变化的知识库。更新这些技能的能力尚未成为一个已解决的问题。该研究强调了一种“无声的陈旧性”(silent staleness),即过时信息会在没有预警的情况下持续存在,为自动化系统带来了隐藏风险。随着软件持续快速演进,引导 AI 智能体的技能必须被视为需要主动进行类似人类维护的版本化资产。研究结果表明,在智能体能够可靠地分辨什么是过时的、什么是仍然有效的之前,它们在复杂且不断演进的软件环境中的应用仍将受到其自身知识脆弱性的限制。未来的路径需要开发新方法,以确保这些数字指南保持准确,或者在每次重大变更后由人类介入进行验证。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。