← 最新论文
🤖 AI

Coalition-Aware Skill Reliability for Self-Evolving Agents

本文通过识别联盟污染(coalition pollution)和跨领域效用反转(cross-domain utility reversal)这两个关键失效模式,解决了自进化大语言模型智能体中累积技能可靠性尚未解决的问题,并提出了联盟感知技能选择(CASS)和无监督技能掩码联盟优化器(u-SMCO),旨在通过可靠性感知的技能管理来增强任务性能和泛化能力。

原作者: Qiyan Zhao, Xiaofeng Zhang, Bo Liu, Minda Chen, Wei Xiong, Jingyang Chen, Guanting Ye, Wenhao Yu, Xiaosong Yuan, Shijie Han, Da-Han Wang, Jianmin Ji, Fei Huang, Xu-Yao Zhang

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Qiyan Zhao, Xiaofeng Zhang, Bo Liu, Minda Chen, Wei Xiong, Jingyang Chen, Guanting Ye, Wenhao Yu, Xiaosong Yuan, Shijie Han, Da-Han Wang, Jianmin Ji, Fei Huang, Xu-Yao Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个能够从自身的错误和成功中学习,并构建一个用于解决新问题的个人“技能库”的数字助手。这些技能不仅仅是对发生过的事情的原始记忆,而是经过提炼、可重复使用的指令——就像厨师学会了切洋葱的具体技巧,并能将其应用于任何食谱一样。在人工智能领域,研究人员正在教大型语言模型正是这样做:收集经验,将其转化为结构化的工具,并存储在“技能库”中以备后用。人们希望随着智能体积累越来越多的技能,它会变得更加聪明和强大,就像人类专家通过多年的实践变得更加精通一样。

然而,一个基本问题一直悬而未决:拥有更大的技能库是否真的会让智能体变得更好?或者,智能体是否可能在某些情况下囤积了一些无用甚至有害的工具?由来自包括中国科学院和中国科学技术大学在内的多个机构的研究人员开展的一项新研究,调查了正是这个问题。他们发现,仅仅向智能体的记忆中添加更多技能并不保证性能的提升。事实上,技能之间的协作方式比此前认为的要复杂得多,而且目前决定保留哪些技能的方法往往忽视了隐藏的问题。

研究人员首先检查了这些自我进化智能体是如何决定是否接受一项新技能进入其技能库的。通常情况下,智能体会尝试一项新技能,观察整体性能是否有所提高;如果得分哪怕只上升了一点点,该技能就会被保留。团队意识到这种方法是有缺陷的,因为它只关注最终得分,而忽略了新技能如何与现有技能进行交互。他们发现,一项新技能之所以被接受,可能是因为整体得分提高了,但这种提升实际上可能是由同时存在于技能库中的另一项旧的、可靠的技能所导致的。这项新技能本身可能毫无贡献,甚至可能拖累性能,但其负面影响被其合作伙伴的成功所掩盖了。研究人员称之为“联盟污染”(coalition pollution)。这就像是一个团队,由于团队的总产出增加了,一位新成员被录用了,却没意识到这位新成员其实什么也没做,而产出的提升完全来自于已经在努力工作的另一位老同事。这位新员工被留了下来,用一个既没有价值又可能在日后引发摩擦的成员来污染了团队。

研究还发现了当智能体从一种类型的任务转向另一种任务时发生的第二个问题。智能体可能会学到一项在源环境(例如回答关于长篇故事的问题)中表现完美的技能,然后将这项相同的技能带入一个新环境(例如解决逻辑谜题)。研究人员发现,在第一种设定下有用的技能在第二种设定下可能会变得有害。一个能帮助厨师高效切菜的工具,如果厨师试图用同样的切菜动作去组装一块精致的手表,可能会造成灾难。然而,智能体并不知道这一点;它假设既然这项技能以前奏效了,那么它再次使用时也会奏效。研究表明,如果不进行干预,智能体经常会将这些有害的技能带入新的领域,从而主动降低性能。他们称之为“跨领域效用反转”(cross-domain utility reversal)。

为了解决这些问题,团队开发了两种新方法。第一种旨在阻止“联盟污染”,它改变了智能体决定是否保留一项新技能的方式。该方法不再仅仅观察最终得分,而是测试新技能在与现有技能的多种不同组合下的表现。它会询问:“这项技能在与技能 A 配对时是否有帮助?它在与技能 B 配对时是否有帮助?”通过平均这些结果,系统可以辨别这项技能是真正有用的,还是仅仅在搭便车。这确保了只有那些真正对团队成功做出贡献的技能才会被添加到技能库中。

第二种方法解决了技能在新环境中变得有害的问题。由于智能体通常没有标记好的数据来告诉它们一项技能在新的领域中是否有效,研究人员创建了一种无需答案即可测试技能的方法。他们利用智能体自身寻找正确信息的能力来进行测试。如果移除某项特定技能能让智能体更好地在环境中找到正确信息,那么这项技能很可能是有害的,并会被屏蔽或关闭。这使得智能体即使在探索完全陌生的领域且没有老师引导的情况下,也能自动清理其技能库。

研究人员在四个不同的基准测试上测试了这些方法,范围涵盖了从复杂的阅读理解任务到虚拟世界中的模拟机器人导航。在每种情况下,使用这些新方法的智能体表现都优于使用标准技术的智能体。它们能更正确地解决任务,并更有效地将其技能泛化到新情况中。研究还表明,通过关注技能如何协同工作,智能体对训练得分的随机波动变得不那么敏感,从而实现了更稳定的学习。

这项工作的核心发现是,一项技能的可靠性并非技能本身的固有属性。技能并非简单地分为“好”或“坏”。其价值完全取决于它在技能库中所处的环境以及它所处的特定环境。在一种语境下是英雄的技能,在另一种语境下可能就是恶棍;而在单独使用时看似无用的技能,在与正确的伙伴配合时可能至关重要。通过认识到技能是作为一个团队而非孤立的工具在发挥作用,研究人员提供了一种构建不仅更聪明、而且更可靠、更具适应性的智能体的方法。这种视角的转变使该领域从单纯地积累更多数据,转向理解使学习真正有效的复杂关系。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →