← 最新论文
💻 computer science

SkillEvo: Self-Renewing Evolution Gradients from Multi-Turn Interaction Feedback

SkillEvo 是一个通过将多轮用户模拟转化为用于针对性改进的持续反馈生成器,并引入主动治理层以修复结构性退化,从而实现智能体技能持续演进的框架,其性能优于现有的单轮或基于自我反思的方法。

原作者: Qianxi Yan, Chunrong Chen, Jiuzhou Zhao, Min Zhang, Yongzhou Xu, Xiaochuan Xu

发布于 2026-08-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Qianxi Yan, Chunrong Chen, Jiuzhou Zhao, Min Zhang, Yongzhou Xu, Xiaochuan Xu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人如何修理一台坏掉的面包机。在过去,你必须亲手写下每一个步骤:“检查插头”、“寻找烧焦的电线”、“按下复位按钮”。如果机器人犯了错,你必须找到错误所在,重写手册,然后重新开始。这既慢又贵,而且机器人永远无法在实战中通过自身的失败进行学习。

最近,科学家们开始让机器人尝试修理东西,然后询问它们:“你是怎么做到的?”机器人会观察自己的工作,意识到自己漏掉了一个步骤,然后尝试重写自己的指令。这被称为“自我进化”(self-evolution)。但问题在于:大多数这类机器人只能得到一次解释自己的机会。它们尝试修理面包机,得到一个快速的“做得好”或“做得不好”的分数,然后就停止了。它们会错过那些只有在你追问“等等,如果插头松了且电线也烧焦了怎么办?”时才会显现出来的细微错误。它们之所以停滞不前,是因为它们看不见问题更深层的维度。

这就是名为 SkillEvo 的新理念出现的地方。这是一个旨在帮助 AI“智能体”(聪明的计算机程序)通过长期的、来回不断的对话而非仅仅是单次的快速检查来提升工作能力的框架。来自腾讯云和浙江大学的研究人员发现,他们想要解决一个特定的问题:如何让 AI 的知识库不断增长和完善,而不至于变得混乱、困惑或充满谎言?他们发现,秘诀不仅仅是有一个聪明的编辑,而是要有一个聪明的“老师”,通过不断提出后续问题来揭示隐藏的错误,以及一个严格的“检查员”,确保机器人在试图添加新答案时不会意外删除正确的答案。

问题所在:停止学习的机器人

想象一下,你正在玩一款带有新角色的视频游戏。在第一轮中,角色尝试跳过一个坑但失败了。你告诉他们:“你需要跳得更高。”他们改进了,在下一轮中,他们跳跃得很好。但随后,他们尝试在躲避火球的同时跳过一个坑,结果再次失败。如果你的老师只针对第一次跳跃给出反馈,那么这个角色永远学不会如何应对火球。他们会遇到一个“天花 ceiling”,即由于没有针对难题进行测试,他们无法再取得任何进步。

这正是目前的 AI 技能所面临的情况。大多数系统使用“单轮”检查。AI 尝试解决问题,得到一个分数,然后重试。但一旦明显的错误被修复,反馈就会停止。AI 撞到了墙。这就像通过只回答简单的“是”或“否”来学习语言一样;你永远无法学会如何进行复杂的对话。

此外,当这些 AI 尝试自我修复时,它们往往会把事情搞砸。它们可能会添加过多的新信息,导致它们的指令变成了一部充满矛盾的、长达百页的杂乱小说。它们可能会忘记原本应该遵循的规则。这被称为“退化”(degradation)。它们越试图进化,在可靠性方面就表现得越差。

解决方案:SkillEvo 的两部分魔力

该论文的作者提出了一个名为 SkillEvo(技能进化)的新系统。他们认为,让 AI 变得更好的关键不仅在于给它更多编辑自身代码的时间,而在于给予它更好的反馈和更好的规则。他们构建了一个包含两个主要部分的系统:可信反馈生成器(Trustworthy Feedback Generator)和可控治理层(Controllable Governance Layer)。

第一部分:好奇的模拟器(可信反馈)

SkillEvo 不仅仅是向 AI 提一个问题,而是使用一个“模拟器”来扮演一个真实、略显刁钻的人类客户。这个模拟器不会只问一个问题就离开,它会玩一场“二十个问题”的游戏。

  1. 设置: 模拟器阅读一份真实的、杂乱的客户投诉(即“工单”),并创建一个真实的场景。它知道客户的需求、客户已经尝试过的操作,甚至知道客户可能会如何感到沮携。
  2. 对话: AI 尝试提供帮助。模拟器会提出后续问题:“好吧,但如果我试了那个方法却没用呢?”或者“等等,我现在有一个不同的错误代码。”
  3. 揭示: 这种来回的对话剥开了问题的层层外壳。就像在视频游戏中一样,第一轮对话可能会修复容易的问题,但第二轮和第三轮对话会揭示隐藏的、复杂的问题。
  4. 过滤器: 并不是所有的错误都是 AI 的错。有时是模拟器表现得很奇怪,或者 AI 使用的工具本身坏了。SkillEvo 有一个特殊的“归因器”(Attributor)来进行检查:“这是 AI 知识的缺失,还是其他原因?”只有真正的知识缺口才会被转化为反馈。

这创造了一个“自我更新”的梯度。每当 AI 修复一个错误时,模拟器都会提出一个更难的问题,从而揭示下一层缺陷。AI 永远不会缺乏学习的内容。

第二部分:严格的检查员(可控治理)

即使有了优秀的反馈,AI 也可能会变得混乱。如果你让一个学生每天都重写他们的教科书,他们可能会在添加一章艺术课的同时,不小心删掉了数学章节。他们可能会让这本书变成一本千页的废话连篇的书。

SkillEvo 添加了一个“治理”层来阻止这种情况。你可以把它想象成一个严格的编辑,他有两个规则:

  1. 不要删除真相: AI 必须保留它开始时所有的稳定、正确的实事。如果它试图删除一个已知事实,系统会说“不!”并立即修复它。
  2. 不要让书变得臃肿: 系统会检查 AI 是否在添加不必要的废话,或者是否破坏了其知识各部分之间的联系。如果 AI 的“知识图谱”变得纠缠不清或过于庞大,系统会主动进行修复,修剪掉死胡同并收紧结构。

这确保了随着 AI 变得越来越聪明,它不会变得混乱。它能保持组织有序且可靠。

实验结果:数据说话

研究人员在用于云服务的 9 项真实世界技能(如修复数据库问题或管理服务器)上测试了这个系统。他们将 SkillEvo 与三种其他方法进行了对比:

  • 原始技能: 起始点,从未更新。
  • 自我反思(Self-Reflection): AI 在没有任何外部反馈的情况下尝试自我修复。
  • 单轮问答(Single-Turn QA): AI 从仅有一次问答环节中获得反馈。

结果非常明确。“自我反思”法几乎没有进步,只是在原地踏步。“单轮问答”法起初有所提升,但随后遇到了瓶颈,成功率停留在 66.4% 左右。

然而,SkillEvo 则持续攀升。通过利用多轮对话来发现深层问题,并利用治理层来保持整洁,它达到了 81.8% 的成功率。这比单轮法提高了 15.4 个百分点,比最初未更新的技能提高了惊人的 51.8 个百分点

他们还测量了 AI 的“知识书”增长了多少。如果没有治理层,书的体积增长了 16.2%,变得臃肿且混乱。有了治理层,它仅增长了 2.8%,证明了 AI 在学习过程中非常高效,没有添加不必要的垃圾信息。

这为什么重要

这篇论文表明,AI 的未来不仅仅在于制造更大的模型或让它们自我编辑。而在于我们如何与它们交流,以及我们如何检查它们的工作。通过将一个简单的“测试”转变为一场长期的、揭示性的对话,并通过添加一个严格的“治理”系统来防止 AI 陷入混乱,我们可以创造出能够真正随时间演进并不断进步的 AI。

作者在腾讯云的真实生产环境中测试了这一点,这意味着这不仅仅是一个理论,而是一个在涉及真实客户时确实有效的系统。他们证明了,如果你给 AI 一个会提出正确后续问题的老师,以及一个能保持其诚实的严格编辑,AI 就可以进化成为一个更加强大且可靠的助手。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →