SkillGate: Training In-Policy Skill Selection in Long-Horizon Agents
SkillGate 引入了一种新颖的训练框架,通过将信用分配解耦为不相交的通道,解决了长程智能体中的“选择器信用饥饿”问题,从而在策略内技能选择准确性和整体任务成功率方面,较之标准的基于结果奖励的强化学习有了显著提升。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代人工智能的版图中,大型语言模型已从被动的文本生成器演变为能够驾驭复杂数字环境的主动智能体。这些系统不仅是在描述世界,更是在与世界互动,利用软件工具进行代码修复、文件管理,并通过一系列推理步骤和行动来解决问题。为了处理面临的海量任务,开发者开始将程序化知识封装进可重用的模块中,称之为“技能”(skills)。想象一个包含数千种此类技能的数字图书馆,每种技能都有一个名称和一段简短的描述,等待着智能体在需要时将其开启。对于这些智能体而言,关键的挑战不仅在于拥有访问这个图书馆的权限,而在于知道何时该打开哪一个特定的文件。这种决策必须在任务执行过程中做出,通常仅基于一行描述,且是在智能体看到文件的完整内容之前。如果智能体选错了技能,整个努力都可能失败;然而直到目前为止,还没有可靠的方法能教会智能体如何正确做出这种选择。
长期以来,研究人员一直假设使用标准方法训练这些智能体就足够了:向智能体展示一组候选技能列表,让它尝试解决任务,并仅在最终结果成功时给予奖励。其核心理念是,智能体会因为正确的选择能带来好的结果,从而自然而然地学会挑选正确的技能。然而,一项新的研究表明,这种方法存在一个根本性的缺陷,阻碍了智能体有效地学习技能选择,尤其是在长且复杂的任务中。研究人员发现,当智能体未能完成任务时,告知其出错原因的训练信号会平等地广播到智能体生成的每一个词语上。在一个长序列的行动中,用于命名所选技能的寥寥数词,会被用于推理和执行的成千上万个词语所淹没。因此,智能体几乎无法接收到关于其初始选择的反馈。更糟糕的是,如果智能体选对了技能但在后续环节因其他错误而失败,训练系统仍会惩罚其初始选择,从而误导智能体认为那个正确的决定其实是错误的。研究人员将这种现象称为“选择器信用饥渴”(selector credit starvation),这意味着在长序列中最重要的决策,往往是接收到的指令最少且最具误导性的决策。
为了解决这个问题,研究团队开发了一种名为 SkillGate 的新训练方法。SkillGate 不再将整个行动序列视为一个单一的整体,而是将学习过程拆分为两个独立的通道。其中一个通道评估任务的执行情况,根据最终目标是否达成来奖励或惩罚智能体。另一个通道则专门聚焦于智能体命名技能的那一瞬间。第二个通道仅观察用于识别所选文件的特定词汇,并提出了一个简单的问题:这是否是该项工作的唯一正确文件?如果智能体选对了技能且仅调用了一次,无论后续任务成功与否,它都会因该特定选择而获得正面反馈。如果它选错了文件或选择了多个文件,则会收到负面反馈。通过将命名技能的决策与任务的结果分离,该系统确保了智能体能够区分出“因好选择导致坏结果”与“因坏选择导致坏结果”之间的差异。
这种方法的成果在涉及复杂智能体任务的五个不同基准测试中得到了验证。研究人员使用这种新方法训练了一个拥有 90 亿参数的模型,并将其与仅基于最终结果进行训练的模型进行了对比。经过 SkillGate 训练的模型实现了 53.2% 的成功率,显著高于仅靠最终结果训练模型的 47.0% 成功率。这种提升不仅仅是模型变得更聪明了,其行为发生了具体且可衡量的变化。SkillGate 模型阅读误导性或无关技能的可能性大大降低,将其暴露在错误选项下的概率减少了三分之二,并且它阅读的技能总量也更少,这表明其选择过程更加果断且准确。研究还表明,仅仅扩大模型规模并不能解决问题;即使是规模大得多的模型,在学习技能选择任务方面的效果也比不上经过 Skillgate 训练的小型模型。
这项工作的意义在于,它证明了智能体如何学习与其看到的数据同样重要。研究人员通过审计使用旧方法训练的模型的数据,验证了他们的诊断。他们发现,随着任务长度的增加,到达技能命名词汇的训练信号份额急剧萎缩,变得几乎不可见。此外,到达的信号往往与预期相反,仅仅因为任务最终失败就惩罚正确的选择。通过构建一个让技能选择根据其自身价值而非任务结果进行评判的系统,研究人员消除了这一结构性障碍。这种新方法让智能体能够明白,挑选正确的工具本身就是一种独特且有价值的技能,值得拥有清晰且直接的指令。这一发现表明,要让智能体在复杂环境中变得真正可靠,其训练必须精确到能够区分“采取行动的决策”与“行动产生的结果”。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。