Online Monitoring and Corrective Steering of Programming Agents
本文介绍了 LivePlan,这是一个高性价比的框架,它通过采用一个确定性监控器来实时检测行为漂移,并选择性地向 LLM 顾问寻求针对性的修正,从而在处理复杂的 GitHub 问题时增强编程智能体的性能,进而以极低的开销实现了解决率的显著提升。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个计算机可以编写自身软件的世界,它们能自动修复漏洞并构建新功能。这就是“AI智能体”(AI agents)的领域——这些数字员工利用大语言模型(LLM,即聊天机器人背后的那种聪明大脑)来阅读代码、找出问题所在并尝试修复它。但问题在于:这些数字员工并不完美。有时它们会分心、偏离路径、一遍又一遍地重复同一个错误,或者在完成任务前就放弃了。这就像派一个非常聪明但容易困惑的机器人进入一座巨大的图书馆去寻找一本特定的书;它可能会开始读错区域,或者陷入试图打开一扇锁着的门的死循环中,或者在找到书之前就决定离开。研究人员对此深感关注,因为如果我们希望 AI 能处理像修复大型软件项目这样复杂的现实世界工作,我们就必须确保这些智能体不会仅仅是偏离目标或在死胡同里浪费时间和金钱。
于是有了 LIVEPLAN,一个旨在成为这些编程机器人的警觉、实时教练的新系统。研究人员刘书阳及其团队注意到,以往试图纠正这些“走神”智能体的尝试都有一个重大缺陷:它们通常试图使用同一个 AI 大脑同时进行“评判”机器人的工作和“提供建议”。这就像要求一名裁判既要吹哨判定犯规,又要立即告诉球员接下来的比赛该如何打一样。问题在于,裁判可能会感到困惑,凭空捏造一个并未发生的犯规,并给出错误的指令,反而让球员表现得更糟。
LIVEPLAN 通过将工作职责拆分为两个截然不同的角色来解决这个问题。首先,它使用了一个确定性监控器(deterministic monitor)——可以将其想象成一名严格遵守规则的交通警察。这位警察不会猜测或产生幻觉;它只是观察是否有明显的故障迹象,比如机器人连续两次采取相同的步骤、跳过了关键的安全检查,或者对着同一面墙盯着看了太久。如果交通警察看到了问题,然后它才会请出一位智能顾问(smart advisor)(一个强大的 AI)来提供关于如何重回正轨的高层级简要提示。关键在于,只有当交通警察说“嘿,这里出了问题”时,顾问才会开口说话,而不是不断地用未经请求的建议来打断机器人。
团队在真实的 GitHub 问题(GitHub issues,类似于修复大型软件项目中漏洞的任务清单)上测试了这个系统。他们发现 LIVEPLAN 改变了游戏规则。与那些只是在没有教练指导下运行的“原生”(vanilla)智能体相比,LIVEPLAN 帮助解决了显著更多的难题——在最难的任务上,成功率提升了高达 15.2%,平均提升了 9.9%。或许最令人印象深刻的是,它实现的这一目标仅增加了每次修复约 0.08 美元 的微小成本。
论文还展示了如果不采用这种谨慎方法会发生什么。他们测试了其他方法,这些方法试图重新规划机器人的整个旅程,或者进行过于频繁的检查。这些方法往往适得其反:“重新规划”型的教练有时会凭空捏造不存在的问题,并将机器人引向徒劳的追逐;而“频繁检查”型的教练则往往给出的建议为时已晚,失去了作用。LIVEPLAN 在看到明确信号后再进行干预的方法被证明是最佳平衡点。它成功地引导智能体度过了那些通常会让它们束手无策的棘手的中等和困难问题,同时又没有干扰那些它们原本擅长处理的问题。简而言之,通过让一个简单的规则检查器守住门口,并在必要时才请出“大脑袋”,研究人员找到了一种让这些数字员工保持专注、高效且更有可能完成任务的方法。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。