← 最新论文
💻 computer science

IL-ACT: Imitation Learning with Adaptive Cartesian Tracking Control for a 30-ton Excavator

本文提出了 IL-ACT,一种通过自适应笛卡尔跟踪和停止距离调节器进行增强的新型模仿学习框架,该框架在各种液压和传感条件下,通过显著降低跟踪误差并提高目标完成率,证明了其在 30 吨挖掘机自主控制方面优于基准方法的性能。

原作者: Mehdi Heydari Shahna, Seihun Kim, Soyi Jung, Soohyun Park, Jouni Mattila, Joongheon Kim

发布于 2026-09-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Mehdi Heydari Shahna, Seihun Kim, Soyi Jung, Soohyun Park, Jouni Mattila, Joongheon Kim

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

技术摘要:用于 30 吨挖掘机的 IL-ACT 控制框架

问题陈述

重型液压机械(特别是 30 吨级挖掘机)的自主控制面临着耦合运动学、执行器滞后和系统不确定性带来的显著挑战。虽然先前的系统已展示了轨迹优化和学习型逆控制的能力,但在存在不确定动力学和变化运行工况的情况下,实现鲁棒且高精度的跟踪仍然十分困难。作者针对如何构建一个能够处理此类复杂机械的目标到达(goal-reaching)与轨迹跟踪任务的运动控制框架,旨在平衡模仿学习(IL)的优势与自适应控制的鲁棒性。

方法论:IL-ACT 框架

本文提出了一种名为 IL-ACT(带有自适应笛卡尔跟踪的模仿学习)的新型运动控制框架,该框架专为一台具有四个受控关节(回转、动臂、斗杆和铲斗)的 30 吨液压挖掘机设计。该系统以 0.1s 的控制周期进行闭环运行,由三个主要部分组成:

1. 锚定模仿策略 (Anchored Imitation Policy)

  • 架构: 一个通过行为克隆(behavior cloning)在操作员演示数据上训练的全连接神经网络(14 个输入,4 个输出)。
  • 训练策略: 该策略在遥测语料库(15 个记录日期)上进行预训练,并使用离线运动学监督进行精炼。一个“运动学教师”(kinematic teacher)负责重建配置,并生成有界的逆运动学(IK)姿态引导和笛卡尔速度指令。
  • 锚定机制: 为了确保稳定性及零动作一致性,策略输出被定义为当前状态的神经网络预测值与“零动作”锚定状态(即目标与当前位姿一致且速度为零)的预测值之差。这确保了当系统处于目标位置且无运动时,标称指令精确为零。
  • 观测值: 输入向量包括因果滤波后的关节角度、末端位置以及指向调节点(目标点或预览点)的误差向量。

2. 自适应笛卡尔跟踪 (Adaptive Cartesian Tracking, ACT)

  • 反馈校正: 系统采用笛卡尔反馈回路,计算期望末端位置与测量末端位置之间的误差。
  • 增益/偏差估计: 一个门控估计器通过比较测量关节速率与标称植物响应预测值来估算增益和偏差修正量,以补偿由液压不确定性(阀门滞后、摩擦、负载调制)引起的偏差。
  • 自适应逻辑: 增益和偏差估计值的更新基于激励水平进行“门控”(以避免在低信号或饱和状态下进行自适应)以及干预标志。
  • 集成: 最终指令是标称 IL 输出、通过阻尼逆雅可比矩阵映射到关节空间的笛卡尔反馈速度,以及估计的偏差/增益修正量的组合。

3. 共享指令调节器 (Shared Command Governor)

  • 安全性与可行性: 停止距离调节器对生成的关节参考值进行约束,以确保机器能够在达到目标前在其物理极限(位置、速度和加速度边界)内停止。
  • 参考值容许性: 调节器确保位置需求寄存器保持在声明的包络线内。如果调节器检测到不可行状态,它会触发回退减速而非瞬时停止。
    以上系统利用抗饱和积分(anti-windup integration)处理反馈回路中的积分项,以防止在饱和期间出现性能退化。

主要贡献

作者确定了三个主要贡献:

  1. 锚定模仿策略设计: 一种通过数据集聚合和运动学监督进行精炼的协同四关节策略,具有确保稳定性的精确零动作锚定机制。
  2. 带有约束参考生成的自适应跟踪: 一个结合了笛卡尔反馈、门控增益/偏差估计以及共享停止距离调节器的框架。论文提供了理论分析,在以调节器可行性为前提条件下,确立了自适应状态的有界性和生成参考值的容许性。
  3. 全面的对比仿真证据: 在多种任务(目标调节、螺旋线、图形 8 字形和圆形栅格跟踪)和工况(标称 vs. 受扰动的液压响应、传感器噪声、额外负载)下进行了广泛评估。研究包含了针对多种训练种子和初始化策略的调优 PID、仅 IL 以及 Teacher+ACT 基准模型的对比。

实验结果

该框架在模拟 30 吨挖掘机及其液压扰动(阀门滞后、摩擦、滞后现象、负载调制)的高保真 Simscape 环境中进行了评估。

目标调节 (100 个连续目标)

  • 成功率: 在标称和受扰动条件下,IL-only 和 IL-ACT 均实现了 100/100 的成功率,而 PID 分别在标称和受扰动条件下仅达到 95/100 和 86/100。
  • 效率: 与 Teacher+ACT 相比,IL-ACT 完成所有目标所需的时间更短,终端误差更低。具体而言,与 Teacher+ACT 相比,IL-ACT 在标称条件下缩短了 7.22% 的持续时间,在受扰动条件下缩短了 12.97%。
  • 精度: 在标称和受扰动响应下,与 Teacher+ACT 相比,IL-ACT 分别降低了约 16.16% 和 28.39% 的平均终端误差。

轨迹跟踪 (螺旋线、图形 8 字形、栅格)

  • 螺旋线跟踪: IL-ACT 的表现显著优于 PID 和 IL-only。在存在液压扰动的情况下,IL-ACT 实现的笛卡尔跟踪 RMSE 为 0.05864 mm,而 PID 为 12.48 mm,IL-only 为 2.49 mm。
  • 泛化能力: 在涉及三种训练种子和两种初始化(遥测初始化 vs. 随机初始化)的 88 次运行的扩展研究中,经过遥测初始化的 IL-ACT 在所有 24 组图形 8 字形和圆形栅格对比中,其 RMSE 均低于 Teacher+ACT。
  • 负载与噪声鲁棒性:额外负载螺旋线 条件下,经过遥测初始化的 IL-ACT 比 Teacher+ACT 的平均 RMSE 降低了约 29%。在共享传感器噪声实现条件下,其平均 RMSE 比 Teacher+ACT 低 27.67%。
  • 估计器影响: 在传感器噪声条件下,启用增益/偏差估计器使平均 RMSE 相对于冻结估计器降低了 22.44%。

重要性与主张

论文声称 IL-ACT 成功地将模仿学习的数据驱动效率与自适应控制理论的鲁棒性结合在一起。

  • 鲁棒性: 该框架在存在显著液压不确定性和外部扰动的情况下,表现出优于纯模仿学习(IL-only)和基于模型的基准(PID)的性能。
  • 理论保证: 不同于许多黑盒学习方法,作者提供了理论分析,证明了只要调节器保持可行,自适应状态和笛卡尔反馈指令将保持有界,且生成的参考值是容许的。
  • 实际应用价值: 结果表明,将预训练策略与在线自适应及安全调节器相结合,是实现重型机械自主控制的一条可行路径,它在学习的样本效率与工业操作的安全要求之间取得了平衡。

作者对研究范围保持谦逊,指出这些发现是针对所评估的仿真条件的,且预训练权重的影响可能因具体任务和初始化方式的不同而呈现复杂结果。该工作并不声称解决了自主挖掘的所有方面(例如,目标定位被视为一个独立的阶段),而是专注于运动控制和轨迹跟踪阶段。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →