Residual Reward Models: Leveraging Prior Knowledge for Efficient Preference-based Reinforcement Learning in Robotics
本文介绍了残差奖励模型(Residual Reward Models, RRM),这是一种将奖励函数分解为先验知识组件和可学习残差偏移量的方法,旨在显著增强基于偏好的强化学习在机器人领域的样本效率和实际应用能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
教机器人完成一项复杂的物理任务,比如按下一个按钮或拿起一个脆弱的物体,是工程师面临的一个难题。在机器人领域,机器需要一套指令,告诉它哪些动作做得好,哪些做得不好。这套指令被称为奖励函数(reward function)。如果指令模糊或错误,机器人可能会学会绕过系统,寻找一种无需完成任务就能获得高分的方法,或者可能因为无法弄清预期目标而直接放弃。传统上,人类必须亲手编写这些指令,猜测哪些动作会导致成功。这个过程缓慢、昂贵,并且当机器人遇到人类未曾预见的状况时,往往会失败。
一种被称为“基于偏好的学习”(preference-based learning)的新方法试图解决这个问题,它让人们只需简单地指出两个机器人动作中哪一个看起来更好,而不是编写复杂的规则。虽然这听起来更简单,但它创造了一个新问题:机器人需要通过成千上万次的这种比较才能学到有用的东西。在现实世界中,要求人类观看并评判机器人如此多次是不切实际且成本高昂的。机器人的学习速度太慢,而人类注意力的成本成为了阻碍这些机器在实验室之外发挥作用的瓶颈。
多伦多大学和清华大学的研究人员开发了一种能够显著加速这一过程的方法。他们称之为“残差奖励模型”(Residual Reward Model)。这种方法并不要求机器人从零开始,而是允许机器人先拥有一个关于任务该如何完成的“最佳猜测”。这个猜测可以来自工程师编写的一个简单规则、由大型语言模型生成的描述,甚至是观察人类执行任务一次后学到的奖励函数。机器人随后将这个初始猜测作为基础。当人类提供偏好反馈,说“这个动作比那个更好”时,机器人并不会尝试重写整个规则手册。相反,它只学习相对于初始猜测所需的微小差异,即“残差”(residual)。
可以将它想象成一名已经掌握了某项运动基本规则的学生,只需要教练指出其技术中的细微之处。学生不需要重新学习如何奔跑或投掷;他们只需要根据教练的反馈对动作进行微调。同样,机器人利用人类的反馈,对其现有的任务理解进行微小且精确的调整。这种结构保持了学习过程的稳定性。如果初始猜测不完美,机器人仍然可以学习,因为它只需要纠正错误,而不是从无到有地发现整个概念。
研究人员在多种模拟环境中测试了这一想法,包括机器人手臂需要按按钮、将物体扫入箱子或解锁门等任务。他们还在实验室环境下使用真实的物理机器人——Franka Panda机械臂进行了测试。在每种情况下,使用这种“最佳猜测”加“微小修正”的方法,都比仅通过人类偏好从头开始学习的方法要快得多。在模拟实验中,使用这种新方法的机器人达到了完美的成功率,且所需的人类判断次数远少于其他方法。例如,在机器人需要按按钮的任务中,试图从零开始学习的标准方法停滞在20%的成功率,而新方法则达到了100%。
研究还表明,这种方法对错误具有鲁棒性(稳健性)。如果初始的“最佳猜测”稍有偏差,或者人类的反馈偶尔存在噪声或不一致,机器人仍然可以学会正确的行为。初始猜测起到了安全网的作用,防止机器人陷入无效的行为中,而修正过程则确保它最终能找到正确的路径。这一点在研究人员使用极有限的人类反馈进行测试时尤为重要。即使人类仅被要求提供极少量的判断,使用残差方法的机器人仍能持续改进,而标准方法则无法学到任何有用的东西。
或许最重要的一点是,研究人员证明了这种学习可以直接从计算机模拟迁移到真实的物理机器人上,而无需任何额外的调优。他们在虚拟环境中训练机器人,然后将学到的策略应用于真实的 Franka Panda 机械臂,使其执行伸手拿取物体、推动方块或拿起物体并移动等任务。使用残差方法训练的机器人在执行这些现实任务时,比基准方法快得多。在涉及推动物体的某项困难任务中,标准方法在经过大量训练后成功率仅为一半,而新方法在相同的训练时间内达到了95%的成功率。
研究结果表明,通过将先验知识与人类反馈相结合,机器人可以以比以往认为的更少的人类监督来学习复杂的物理技能。这并不意味着机器人预先知道一切,而是指它利用已知的知识作为起点,从而最大限度地利用收到的每一条人类反馈。这种效率可能是让机器人助手在现实工作中变得实用的关键一步,因为在现实工作中,时间与人类注意力都是有限的资源。这项工作证实,给机器人一个起步点(哪怕是一个粗略的起步点),可以让它以比从空白状态开始更快、更可靠的方式,从人类的偏好中学习。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。