✨ 要点🔬 技术摘要
通过观察人类完成动作来学习新技能的机器人不再仅仅是科幻小说中的梦想,而是如今实验室中正在构建的现实。这一被称为“从演示中学习”(learning from demonstration)的领域,让机器能够通过观察专家,吸收复杂的动作,例如组装零件或清洁表面。这些机器人并非通过僵化的、逐步的指令进行编程,而是利用数学模型来理解运动的流向,从而创造出一条可以重复的平滑且连续的路径。然而,机器人在脑海中规划出的完美路径与混乱的物理现实之间往往存在着显著的差距。当机器人尝试执行计划时,未知的力量——如摩擦力、传感器延迟或意外的碰撞——可能会使其偏离航道。机器人的内部模型可能显示其运行完美,但实际的手臂却在滞后或漂移,这种脱节会导致任务失败。
伊利诺伊大学厄巴纳-香槟分校和加州大学伯克利分校的研究人员开发了一种新系统来弥补这一差距,确保机器人的物理动作即使在环境干扰的情况下,也能忠实于其学习到的意图。他们的方法被称为 L1-DS,它充当了机器人运动计划的强力守护者。它可以在任何现有的学习系统中增加两层保护:一个用于温和引导机器人回到预期路径的稳定控制器,以及一个用于积极对抗意外干扰的自适应控制器。与以往那些通常要求机器人拥有其内部机械结构的完美、详细地图的方法不同(许多现代复杂机器并不具备这种奢侈条件),这种新架构无需了解机器人底层电机或传感器的具体细节即可运行。它在任务层面进行操作,通过观察运动并在实时状态下纠正误差,而无需理会机器内部发生的具体情况。
为了理解其工作原理,请想象一个机器人通过观察人类手部动作来学习绘制形状的过程。机器人会创建一个关于目标运动的心理地图,即它打算遵循的一条平滑曲线。在一个完美的世界上,机器人只需追踪这条曲线即可。但在现实中,如果机器人被撞了一下或者传感器反应迟钝,它可能会落后,试图追赶一个在时间上已经错过的曲线上的一点。如果机器人盲目地试图冲向那个旧的点,它可能会做出剧烈且不自然的动作,从而破坏形状。研究人员通过给机器人一种更聪明的选择目标的方式解决了这个问题。机器人不再根据固定的时钟来决定自己应该在哪里,而是观察它刚刚绘制出的路径形状,并找到与当前位置最相似的路径点。这使得机器人即使在领先或落后于进度时,也能与运动的节奏保持同步。
一旦机器人知道了相对于计划的位置,系统就会启动其自适应控制层。这一层就像一只持续存在的、无形的“手”,感知任何试图将机器人带离航道的推力或拉力。它不需要确切知道干扰是什么或来自何处;它只需检测到机器人的运动与预测不符,并产生一个反向作用力来抵消它。这一过程发生得极其迅速,每秒对机器人的指令进行数千次调整,以保持运动的平滑与精准。研究人员使用手写数据集对该系统进行了测试,要求机器人描绘各种字母和形状。他们模拟了两类挑战:一种是机器人的内部指令执行完美但环境受到干扰的情况;另一种是机器人的电机和传感器本身不完美、无法精确执行指令的情况。
结果显示,这种新架构的表现显著优于现有方法。在涉及突然推挤、持续拖拽和复杂节奏性干扰的测试中,使用这种新方法的系统比没有这些保护措施的系统能让机器人的路径更接近预期形状。当机器人面临执行不完美的条件(即计划与物理现实之间差距最大的时候)时,提升效果最为显著。通过结合一种智能的同步方式和一种强大的抗干扰能力,研究人员证明了机器人可以学习复杂的技能,并在不可预测的环境中可靠地执行。这项工作表明,对于希望在现实世界(一个永不完美平滑或可预测的世界)中运行的机器人而言,它们需要的不仅仅是对如何运动的良好记忆,更需要一种在情况出错时仍能保持航向的韧性。
技术摘要:一种针对学习型动力系统的鲁棒任务级控制架构
问题陈述 基于动力系统(Dynamical System, DS)的学习演示(Learning from Demonstration, LfD)是用于在机器人任务空间中生成运动规划的一种流行方法,其通过学习一个将状态映射到速度的向量场来实现。然而,在部署过程中经常会出现一个关键的“任务执行失配(task-execution mismatch)”问题。虽然学习到的动力系统生成了名义运动规划,但实际执行过程经常受到未建模动力学、持续外部扰动、感知延迟和系统延迟的影响。这种失配导致机器人的真实任务空间状态偏离预期的轨迹。现有方法通常假设存在一个“完美执行器”,或者依赖于需要精确系统模型的底层控制器,而对于复杂的或商业化的“黑盒”机器人而言,这些模型难以获取。此外,虽然某些方法将鲁棒性嵌入到学习到的动力学中,但它们往往难以处理时间失配(相位偏移)问题,或者需要手动指定关键区域。
方法论:L1-DS 架构 作者提出了 L1-DS ,一种新型的任务级控制架构,旨在显式处理任务执行失配,且无需访问底层控制栈或精确的系统模型。该框架通过三个核心组件增强了任何现有的基于 DS 的 LfD 模型:
名义稳定控制器(基于 CLF): 学习到的动力学 f θ f_\theta f θ 生成名义目标轨迹 z ∗ ( t ) z^*(t) z ∗ ( t ) 。为了确保稳定性,作者引入了一个基于控制李雅普诺夫函数(Control Lyapunov Function, CLF)的二次规划(QP)。该控制器计算一个稳定输入 u n o m u_{nom} u n o m ,在假设不存在扰动的情况下,迫使跟踪误差 e ( t ) = z ( t ) − z ∗ ( t ) e(t) = z(t) - z^*(t) e ( t ) = z ( t ) − z ∗ ( t ) 指数级收敛至零。
基于窗口 DTW 的目标选择器: 为了解决时间失配问题(即由于扰动导致机器人滞后或领先于名义轨迹),作者引入了一种目标选择机制。该系统不再使用严格基于时间的索引目标 z ∗ ( t ) z^*(t) z ∗ ( t ) (这可能导致“相位不一致”误差),而是使用**窗口动态时间规整(Windowed Dynamic Time Warping, DTW)**算法。该算法将机器人的近期执行历史与名义目标轨迹在向前看(forward-looking)的窗口内进行对齐。它通过选择使历史记录与候选子轨迹之间的几何距离(DTW 代价)最小化的目标点 z ∗ z^* z ∗ ,从而确保控制器跟踪一个相位一致的参考。
L1 自适应控制增强: 为了处理残余的“任务执行失配”(建模为由延迟和未建模动力学引起的匹配不确定性项 σ ( z ) \sigma(z) σ ( z ) ),该架构集成了一个 L1 自适应控制器 。该组件包括:
使用状态预测器来估计不确定性。
采用分段常数自适应律来更新估计值。
将估计值通过低通滤波器以生成自适应控制输入 u a ( t ) u_a(t) u a ( t ) 。
将估计与控制解耦,即使在存在高频噪声和不确定性的情况下,也能确保统一的瞬态性能和鲁棒裕度。
数学证明表明,只要满足特定的滤波器带宽和采样时间条件,闭环系统可以将实际状态 z ( t ) z(t) z ( t ) 保持在名义轨迹 z ∗ ( t ) z^*(t) z ∗ ( t ) 周围的一个有界管状区域内。
核心贡献
任务级鲁棒性: 该架构纯粹在任务层级解决任务执行差距,使其与机器人底层的控制栈无关,并适用于“黑盒”系统。
相位一致的跟踪: 引入的基于窗口 DTW 的目标选择器使名义稳定控制器能够有效处理时间失配,防止由相位偏移引起的性能下降。
理论保证: 本文提供了形式化的稳定性分析,证明了在存在匹配不确定性的情况下,L1-DS 架构能确保系统状态在名义轨迹周围实现一致最终有界。
模型无关性: 该框架可以为任何 基于 DS 的 LfD 模型(如 Neural ODEs, SEDS)增强鲁棒属性,而无需重新训练底层的动力学模型。
结果 L1-DS 的有效性通过使用 Neural Ordinary Differential Equation (NODE) 作为基础学习模型,在 LASA (非周期性)和 IROS (周期性)手写数据集上进行了经验验证。
实验场景: 在“完美指令跟随”(直接向任务动力学注入扰动)和“不完美指令跟随”(模拟底层植物动力学和执行器延迟)两种模式下测试了性能。
扰动类型: 系统针对阶跃扰动、恒定扰动以及多正弦扰动(包括匹配和不匹配扰动)进行了测试。
性能指标: 使用归一化动态时间规整(DTW)得分,L1-DS 始终优于基准学习模型(NODE)和 CLF 增强模型(NODE+CLF)。
在 LASA 数据集中,L1-DS 显著降低了 DTW 得分(例如,在完美模式下的阶跃扰动中,从 0.627 降至 0.118)。
在 IROS 数据集中,结合了 DTW 目标选择器和 L1 增强的组合表现最佳,证明了目标选择器本身提升了名义控制器,而自适应层进一步增强了这一效果。
意义与主张 本文声称 L1-DS 为解决任务执行失配(一个在部署学习运动规划时持久存在的挑战)提供了一种鲁棒的解决方案。通过结合基于 CLF 的稳定性、基于 DTW 的几何相位对齐以及 L1 自适应控制,该架构确保了即使在存在未建模动力学和外部扰动的情况下,机器人也能忠实地执行复杂的运动规划。作者强调,这种方法不需要修改学习到的动力学模型,也不需要访问底层控制接口,这使得它成为现实世界机器人系统的一个实用解决方案。未来的工作被确定为将这些验证扩展到更高维度的任务空间、物理机器人操作器以及多步骤顺序任务。
每周获取最佳 electrical engineering 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。