PCSD: Persistent Consistency for Self-Distillation in Agentic Reinforcement Learning
该论文提出了持久一致性自蒸馏(Persistent Consistency Self-Distillation, PCSD),这是一种基于教师信号的局部持久性来生成自适应标记级蒸馏权重的新方法,旨在有效地将密集引导与稀疏环境反馈相结合,从而显著提升语言模型智能体在 ALFWorld 和 WebShop 等复杂交互式任务中的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个机器人玩一款非常长且复杂的电子游戏。这个机器人的大脑是一个被称为“大语言模型”(LLM)的巨型大脑,它必须连续做出数百个微小的决策才能达成目标。问题在于,游戏只会在最后给出“赢”或“输”的分数。这就像是在下国际象棋,直到第50步之后才会被告知是否获胜,而过程中没有任何提示告诉你中间的哪些步骤是好是坏。这使得学习变得异常困难,因为机器人不知道究竟是哪些具体的步骤导致了胜利。
为了提供帮助,科学家们尝试了一种叫做“自我蒸馏”(self-distillation)的技巧。想象一下,机器人有一个超级聪明、处于冻结状态的自身版本(即“老师”),它掌握着所有的秘密策略。这位老师会观察机器人的游戏过程,并为每一个步骤低声耳语:“嘿,那一步走得好!”或者“不,试试这个!”但问题在于,即使是这位超级聪明的老师,在紧张时刻也可能会感到困惑或犯错。如果机器人每次都盲目地模仿老师,它可能会学坏。研究人员试图解决的核心问题是:我们如何教机器人只在老师确实正确时才听从老师,而在老师只是在瞎猜时忽略老师?
这就是一种名为 PCSD(用于自我蒸馏的持续一致性,Persistent Consistency for Self-Distillation)的新方法登场的地方。这项研究背后的研究人员意识到,老师的建议不应该仅凭一个瞬间来判断。PCSD 不仅仅看某一个步骤,而是观察一个步骤的“邻域”,以观察老师的支持是否具有持续性(persistent)。这就像是一群人在为一名跑步者欢呼。如果人群只为他欢呼了一秒钟,那可能只是随机的噪音或失误。但如果人群在连续几秒钟内都为这名跑步者大声喝彩,那才是真正的支持信号。PCSD 利用这个概念来过滤掉“噪音”,只有当老师的建议是连贯且稳定的,才会让机器人从中学习。
论文发现这种“持续性”检查效果非常好。当他们在两个困难的数字世界——ALFWorld(一个文本驱动的房屋环境,机器人必须完成寻找手表并将其放入保险箱等家务)和 WebShop(一个模拟在线商店,机器人必须购买特定物品)上测试 PCSD 时,机器人的学习速度更快,表现也更好。在不需要任何额外帮助进行实际测试的情况下,PCSD 在 ALFWorld 上实现了 90.6% 的成功率,大幅领先于之前的最佳方法(高出约 15 个百分点)。在购物任务中,它的表现同样非常强劲,证明了通过检查“一致性”的老师支持来学习,比盲目模仿或观察孤立的瞬间是更聪明的学习方式。研究人员指出,通过将这种稳定的引导与常规的游戏奖励相结合,机器人可以更有效地掌握复杂的长期任务。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。