← 最新论文
💻 computer science

SkillMentor: LLM Agent Self-Evolution via Learning Blind-Spot Diagnosis

SkillMentor 是一个新颖的框架,它使 LLM 智能体能够通过学习一种独立的诊断能力来识别并将盲点转化为可复用的技能,从而实现自我进化,在无需更新执行器权重且不依赖人类监督的情况下,将执行器的性能提升了 44.2%。

原作者: Xiaoyi Bao, Yuanzhen Xie, Yunzhi Tan, Jinghang Gu, Zhongqing Wang, Chu-Ren Huang, Bo Hu, Zang Li

发布于 2026-07-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Xiaoyi Bao, Yuanzhen Xie, Yunzhi Tan, Jinghang Gu, Zhongqing Wang, Chu-Ren Huang, Bo Hu, Zang Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个计算机就像是极其快速、聪明的学徒的世界。长期以来,科学家们一直试图通过不断重写它们的“大脑”——增加新的神经元层、调整内部布线、并喂给它们无数的行动范例——来教这些学徒做得更好。这就是“智能体自我进化”(agent self-evolution)的世界,其目标通常是让学徒在“执行”任务时更快、更强。但问题在于:如果学徒不仅需要知道如何行动,还需要意识到自己哪里不知道呢?这就像是一个学生之所以在数学考试中不断失败,不是因为他不会做乘法,而是因为他不知道自己忘了进位。这个大问题在于:我们能否教会一个学徒成为自己错误的侦探,在不需要人类老师指点的情况下,发现自己知识中的隐藏漏洞?

由此诞生了 SkillMentor,一个巧妙的新系统,它颠覆了我们通常训练人工智能的方式。研究人员并没有尝试直接升级学徒的大脑,而是创造了一个微小的、专门的“导师”(Mentor)智能体。把主 AI(“执行者”,Executor)想象成一个试图在一个充满应用程序和工具的巨大、复杂的视频游戏世界中导航的机器人。执行者的状态是“冻结”的;它的脑结构无法被改变或更新。通常情况下,如果机器人失败了,人类会介入说:“嘿,你忘了登录,”然后修复代码。但在这次实验中,人类被禁止进入房间。没有标签,没有提示,没有任何帮助。

那么,机器人是如何变得更好的呢?轮到导师登场了。这个小侦探并不试图亲自玩游戏。相反,它观察执行者的挣扎,然后说:“啊哈!我看出问题出在哪了。”导师的任务是弄清楚机器人为什么失败(诊断),然后编写一个微小的、可重复使用的“小抄”(即一项技能),以帮助机器人在下次避免同样的错误。这就像是导师注意到机器人总是被地毯绊倒,于是写了一张便条贴在机器人的墙上:“小心地毯!”机器人并没有获得新的大脑,它只是获得了一套基于它从自身失败中学习到的更好指令。

研究人员在两个极具挑战性的数字世界中测试了这个设置:一个是 AppWorld,机器人必须在不同的应用(如预订机票或整理文件)之间管理复杂任务;另一个是 BFCLv3,这是一个测试机器人能否正确调用特定计算机函数能力的测试。他们将这个全新的 SkillMentor 与其他依赖于利用庞大、强大的模型来猜测正确答案或使用固定规则的方法进行了对比。结果令人惊讶。尽管导师是一个比其他方法所使用的巨型模型更小、更简单的模型,但它帮助那个冻结的执行者性能平均提升了 44.2%

这里有一个神奇的技巧:导师不仅仅是在猜测,它学会了“如何诊断”。它发现,进步的最佳方式不是更努力地尝试,而是寻找“盲点”——即那些机器人不知道如何处理的特定、反复出现的环节。论文指出,这种诊断能力本身就是一种可以被训练的技能。导师学会了生成棘手的测试用例来暴露机器人的弱点,评估这些弱点的严重程度,然后策划出完美的“修复方案”加入到机器人的工具包中。

最酷的发现之一是,这个系统创造了一个正向反馈循环。当导师修复一个盲点时,机器人变得更强了,这意味着旧的招数不再奏效,新的盲点随之出现。导师随后会发现这些新的差距并修复它们。这是一个自我改进的循环:机器人通过不断更新其外部的“小抄”,而不是通过改变大脑,从而变得越来越聪明。

论文还表明,这些“小抄”是具有可移植性的。如果你在一个较弱的机器人身上训练导师,它学到的技能实际上可以帮助一个更强的机器人,因为较弱的机器人能暴露更多的错误供其学习。反之,从一个超级聪明的机器人身上学到的技能对一个较弱的机器人帮助不大,因为聪明的机器人犯错不够多,无法教授基础知识。这证明了所获得的知识是关于“修复错误的流程”,而不仅仅是记忆答案。

简而言之,SkillMentor 表明,我们并不总是需要让 AI 变得更大或更昂贵才能让它变得更聪明。我们可能只需要教会它如何成为一个更好地侦察自己盲点的侦探。通过将“执行”与“弄清楚哪里出了错”这两个行为分离,研究人员找到了一种让 AI 自我进化的方法,让它在没有任何人类引导的情况下,发现自己的局限性并构建自己的解决方案。这是迈向能够不仅听从命令,而且学会理解自己的不足并如何修复自身的机器的一大步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →