← 最新论文
⚡ electrical engineering

Trajectory-Tracking Control of Multi-DOF Manipulators Subject to Payload Variations using Deep Reinforcement Learning

本文提出了一种基于带有负载领域随机化的软行为者-评论家(Soft Actor-Critic)算法的模型无关深度强化学习控制器,旨在实现六自由度机械臂在复杂、时变负载工况下的高精度轨迹跟踪,并在仿真中证明了其在精度和转矩平滑度方面较传统PID控制有显著提升。

原作者: Xuan Quang Ngo, Huy Hung Nguyen, Tan Tien Nguyen, Van Tu Duong

发布于 2026-08-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Xuan Quang Ngo, Huy Hung Nguyen, Tan Tien Nguyen, Van Tu Duong

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个机器人是终极助手、能够焊接汽车零件、从废墟中营救人员或在仓库中堆叠箱子的世界。但为了让机器人真正发挥作用,它需要准确知道如何移动手臂。这就是“控制器”的工作——它是告诉机器人关节该去向何处的“大脑”。通常,这些机器人会携带物品——工具、沉重的箱子,甚至是随着喷射而变轻的灭火器。问题在于,当机器人手中的重量发生变化时,其手臂移动的方式也会随之改变。这就像试图骑一辆突然背上了沉重背包的自行车;你必须蹬得更用力,并改变转向方式,才能保持在路径上。

多年来,科学家们一直尝试通过传统的数学技巧来教机器人处理这些重量变化。这些方法就像是给机器人一套僵化的规则:“如果变重了,就推得更用力。”但当重量突然或剧烈变化时,这些规则往往会失效,导致机器人摇晃、过度冲过目标点,甚至把自己震碎。于是,一种更新颖、更华丽的想法出现了:深度强化学习(DRL)。可以把它想象成不是通过给机器人一本规则手册,而是通过让它一遍又一遍地玩电子游戏来教学。机器人尝试移动,根据表现获得“分数”,并从错误中学习,直到成为一名大师级玩家。本论文深入探讨了这种“游戏化”方法是否能教会机器人完美地追踪移动目标,即使在手中重量不断变化、缩小或跳跃的情况下也是如此。

研究这些想法的科研人员决定在流行的六轴机器人 UR5e 上测试这个想法。他们想看看是否能使用一种特定的游戏算法——软行为者-评论家算法(Soft Actor-Critic, SAC)来训练这个机器人。巨大的挑战在于,机器人必须在携带从无(0 kg)到重(5 kg)不等负载的情况下,跟随一条快速且曲折的路径。

为了让机器人足够聪明以应对任何重量,团队并没有只用一种特定的负载进行训练。相反,他们使用了一种叫做“领域随机化”(domain randomization)的技巧。想象一下,在一个电子游戏中,关卡设计师在每次开始新游戏时,都会随机改变重力、摩擦力或角色的重量。通过在这样一个混乱、不断变化的环境中进行训练,机器人学会了一种适用于“任何”重量的灵活策略,而不是死记硬背针对某种特定负载的单一方案。他们还通过向机器人输入不仅是当前位置,还有前一时刻的位置以及下一时刻的目标位置,赋予了它特殊的“记忆”。这有助于机器人预判其手臂物理特性的变化,就像冲浪者会看向下一波浪潮,而不仅仅是盯着脚下的水面。

他们的模拟结果非常令人印象深刻。当他们用这种新型的“游戏训练型”控制器与传统控制器(一种标准的 PID 控制器,类似于那种旧式规则手册方法)进行对比测试时,差异非常显著。传统控制器在重量变化时表现得异常吃力。如果机器人在携带重物时重量突然减轻,或者在没有重量时突然变重,旧控制器就会陷入混乱。它会产生过度冲向目标、剧烈震动并产生巨大的跟踪误差。在最困难的测试中(即负载以复杂方式变化:保持静止、缓慢变化、然后突然跳变),旧控制器的平均误差高达 19.41 度,并且使用了大量且不连贯的能量。

相比之下,新的 DRL 控制器则表现得游刃有余。它能将机器人保持在路径上,平均误差仅为 1.41 度。这是一个约 92.72% 的巨大提升。不仅如此,它还更加平滑。旧控制器的扭矩(施加在关节上的力)波动剧烈,平均跳变达 5.26 Nm,而新控制器将这些跳变控制在了 1.72 Nm 以内。这意味着机器人移动得更加优雅,消耗更少的能量,也减少了对电机的压力。

研究还表明,这种“随机化训练”才是成功的秘诀。当他们尝试仅用一种固定重量训练机器人并在不同重量下进行测试时,效果非常糟糕,误差急剧上升。但由于他们在各种混合重量下进行了训练,机器人学会了一项通用的技能。研究人员发现,设计机器人“评分卡”(奖励函数)的方式也至关重要。他们必须平衡三个方面:命中目标的得分、动作平滑度的得分以及不浪费能量的得分。如果他们只关心命中目标,机器人会把自己震碎;如果只关心平滑度,它在纠正路径时的响应就会变慢。这些奖励的完美结合,教会了机器人既精准又温和。

当然,目前这一切都发生在计算机模拟中。作者谨慎地指出,虽然机器人在虚拟世界中成为了冠军,但在走向现实世界之前仍面临障碍。首先,机器人在训练期间有时会有“糟糕的一天”,会出现突然的怪异错误,他们怀疑提供更好的记忆(如长短期记忆网络)可能会有所帮助。他们还警告说,让机器人在现实世界中进行随机探索可能很危险,因此他们需要研究如何将这些虚拟技能安全地转移到物理机器上。

简而言之,这篇论文表明,通过教机器人玩一场规则(重量)不断变化的“游戏”,我们可以创造出比传统方法更具适应性和精确性的控制器。这是迈向能够处理现实世界中混乱、不可预测情况的机器人的重要一步,而无需人类不断调整其设置。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →