Agentic Reinforcement Learning with Self-Distilled Reward Shaping
本文介绍了一种具有自蒸馏奖励塑造能力的智能体强化学习(ADRS)框架,该框架通过由教师置信度和实际回报共同校准与门控的、自蒸馏的特权技能信号,生成与回报相关的标记级信用,从而增强长程语言智能体的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个机器人在一个巨大且凌乱的房子里寻找特定的物品,比如一杯热茶。你不能只在它最终找到茶之后才说“做得好!”如果等到那时,机器人将无法知道哪些具体的步骤是有帮助的——是它推开了正确的门?还是它拿起了正确的杯子?亦或是它只是漫无目的地徘徊了十分钟后才碰巧运气好?这就是**强化学习(Reinforcement Learning)**的核心难题:当最终奖励非常稀缺且遥不可及时,你该如何为那些导致重大成功的微小、中间决策给予肯定?
为了解决这个问题,科学家们经常使用一种被称为**自我蒸馏(Self-Distillation)**的技巧。这就像是一个学生参加考试,然后在考试结束后,同一个学生立即扮演一名严格的老师来为自己的答案评分。这个“老师”版本拥有一份特殊的参考资料(称为“特权信息”),而“学生”在考试期间是没有这些资料的。通过比较学生的做法与拥有参考资料的老师的做法,我们可以判断哪些动作是明智的,哪些仅仅是运气好。然而,这里有一个陷阱:仅仅因为老师认为某个答案是“好”的,并不意味着它真的导致了正确的结果。老师可能会表现得很自信但其实是错的,或者对一个正确的动作感到不确定。
这引出了中国科学技术大学与阿里巴巴集团研究人员的一项新研究。他们解决了如何将这种“老师的信心”转化为可靠的指南,引导机器人的下一步行动,同时确保机器人在实际游戏过程中永远不会使用那份参考资料。他们将这种新方法称为 ADRS(基于自我蒸馏奖励塑造的智能体强化学习)。
研究人员发现,简单地模仿老师的分数是行不通的,因为老师的信心可能会产生误导。有时,老师对一个导致失败的动作表现得非常笃定,或者对一个成功的动作却表现得犹豫不决。为了解决这个问题,ADRS 扮演了一个智能过滤器的角色。首先,它会对老师的分数进行归一化处理,使其在任务的不同部分之间具有可比性。然后,它会检查老师的信心是否与最终结果相符(即:那个自信的动作是否真的带来了胜利?)。如果信心与结果一致,过滤器就会增强该动作的分数;如果两者不一致,则会削弱信号。最后,它在机器人做出决定之前,将这种经过提炼的信号直接注入到机器人的学习过程中。
结果表明,这种方法非常有效。在三个具有挑战性的任务——虚拟房屋导航、模拟网站购物以及在线搜索答案——中进行测试时,ADRS 一致地帮助 AI 智能体表现得更好,尤其是在长距离、复杂的任务上。例如,在房屋导航任务中,该方法帮助特定的 AI 模型实现了 94.5% 的成功率,大幅超越了之前的最佳尝试。研究还表明,该 AI 使用比通常更少的训练数据就学会了这些技能,并且即使在任务发生轻微变化或变得更难时,仍能保持良好的表现。至关重要的是,研究人员证明了 AI 在实际游戏中并不需要那份“参考资料”;它只需要在训练阶段利用这份资料来学习如何自主做出更好的决策。这表明,通过仔细校准我们基于真实结果来信任“老师”意见的程度,我们可以教导 AI 智能体更加可靠且高效地解决复杂的、多步骤的问题。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。