Runtime-Incremental Transformer for Reinforcement-Learning-Based Adaptive Control
本文引入了一种运行时增量式 Transformer 机制,该机制根据上下文表示能力和注意力头冗余度,在强化学习过程中动态地增长和剪枝注意力头,从而消除了具有不可观测摩擦记忆的机器人操作器在长时程自适应控制中的灾难性失败,并消除了对昂贵的离线超参数调优的需求。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
那些能够精准移动的机器人,例如用于组装汽车或处理精细材料的工厂机械臂,依赖于复杂的数学计算来确定应施加多少力。几十年来,工程师们一直使用一种称为计算转矩控制(computed-torque control)的方法,该方法通过计算将关节移动到目标位置所需的精确推力或拉力来进行操作。当机器人的运动是可预测时,这种方法效果很好,但现实世界的机器面临着一个隐藏的问题:摩擦力。虽然有些摩擦力是简单且恒定的,但其他类型的摩擦力,例如被称为斯特里贝克效应(Stribeck friction)的粘滑行为,取决于随时间变化的隐藏内部状态。由于机器人的传感器无法直接观测到这种隐藏状态,系统失去了仅凭当前位置来预测其未来行为的能力。为了解决这个问题,研究人员转向了人工智能,特别是一种称为强化学习(reinforcement learning)的学习方式,即计算机程序通过试错来学习。然而,这些程序通常使用一种特定的架构特征,称为注意力机制(attention mechanism),它就像一个聚光灯,允许人工智能关注其近期历史中的不同部分。这些“聚光灯”或称之为“头”(heads)的数量通常在训练开始前就是固定的,并通过一个漫长且昂贵的搜索过程来确定。如果选定的数量太少,机器人会学习失败;如果太多,系统则会变得低效。
这项研究背后的研究人员致力于通过创建一个能够在学习过程中改变自身想法的系统来解决这种僵化性。他们开发了一种新的控制器,该控制器不会预先决定注意力头的数量。相反,它会在训练过程中观察自身的表现,并在感到任务复杂度过高时增加新的头,或者在意识到某些头毫无作用时移除它们。这一切都是实时发生的,无需停止学习过程。该系统使用两个简单的信号来做出这些决策。首先,它测量从机器人的历史记录中进入了多少新信息;如果信息对于当前的头数来说过于复杂,系统就会生长出一个新的头。其次,它检查每个头对最终决策的贡献程度;如果一个头的贡献微乎其微,系统就会悄悄将其移除。至关重要的是,研究人员设计该系统时,确保增加或移除头不会导致机器人行为出现突然的跳变或误差。当增加一个新头时,它从零影响力开始,以确保机器人的运动保持平滑。当移除一个头时,这种变化非常微小,不会干扰学习过程。
团队在一个面对不同摩擦记忆水平(从短期延迟到长期延迟)的模拟双关节机械臂上测试了这种方法。在以往使用固定数量头的实验中,系统在难度最高的长记忆场景下会完全失败,经常导致机器人失去控制或忽略其携带的重量。使用这种全新的运行时可调节系统,机器人在所有测试中都取得了成功,即使是在旧方法失败的困难案例中也是如此。研究人员发现,系统并没有发现某种内在的、针对特定任务的“自然”头数;相反,在主实验的每一次运行中,它都达到了最大头数上限,并且修剪触发器从未因移除未使用头而启动。有趣的是,这种益处并非来自于系统的最终规模,而是来自于它的生长方式。这种逐渐增加头部的过程就像是一个训练课程,帮助机器人循序渐进地学习,而不是一次性被抛入一个复杂的任务中。这表明,在学习过程中调整架构的能力,比拥有一个庞大且预建的结构更为重要。其结果是,为机器人教授如何处理现实世界中混乱且不可预测的摩擦力提供了一种更稳健且高效的方法,消除了在机器人实际移动前寻找正确设置所需的昂贵试错搜索。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。