← 最新论文
🤖 machine learning

Temporal Attention for Adaptive Control of Euler-Lagrange Systems with Unobservable Memory

本文提出了一种基于时间注意力的元控制架构,用于具有不可观测记忆状态的欧拉 - 拉格朗日系统的自适应控制,结果表明,虽然在短至匹配记忆机制下静态注意力头选择策略优于更深层的 Transformer 基线,但其在长记忆场景中表现不佳,从而激发了将强化学习集成以在运行时进行注意力头剪枝与增长的动态方法。

原作者: Giansalvo Cirrincione, Adriano Fagiolini

发布于 2026-05-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Giansalvo Cirrincione, Adriano Fagiolini

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在驾驶一辆拥有非常奇特且“不可见”的“记忆”的汽车。

通常情况下,如果你踩下油门,汽车会立即做出反应。但在这种特定类型的机械臂(称为欧拉 - 拉格朗日系统)中,关节内部的摩擦不仅仅是简单的阻力。它就像汽车拥有一个隐藏的内部状态——机器中的幽灵——它记得几秒钟前你踩油门的力度。这个“幽灵”(称为不可观测记忆)会影响汽车此刻的运动,但你无法直接看到幽灵。你只能看到汽车的位置和速度。

问题:“盲目”的驾驶员

标准的机器人控制器就像只盯着当下路况的驾驶员。它们不知道幽灵的记忆。当幽灵活跃时(这发生在摩擦情况复杂时),这些标准驾驶员会感到困惑。因为它们是对现实的“滞后”版本做出反应,所以会犯错。

为了解决这个问题,作者尝试使用强化学习(RL)。将强化学习想象成一位通过试错来学习的学员驾驶员。然而,这里有一个陷阱:

  1. 动作空间:学员试图直接学习如何转动方向盘和踩踏板。这是一项巨大且复杂的工作。
  2. 盲区:学员只观察汽车当前的位置,而不是它曾经去过的地方(历史轨迹)。

解决方案:带有“记忆窗口”的“元控制器”

作者提出了一种称为元控制器(Meta-Controller)的新架构。他们不是教 AI 直接驾驶汽车,而是教它调整驾驶员的设置

  • 驾驶员:一个标准、可靠的控制器(即“计算力矩”定律),它掌握驾驶的基本原理。
  • 调节器(元控制器):一个 AI,它观察最近的历史窗口(汽车过去几秒的运动轨迹)。基于这段历史,调节器实时调整驾驶员的灵敏度旋钮(增益)。

这就像有一位副驾驶,它查看过去 10 秒的路况,然后对驾驶员耳语:“嘿,由于 5 秒前发生的情况,现在的道路很滑;让我们把牵引力控制调高一点。”

秘诀:数一数“耳朵”(注意力头)

调节器使用一种称为自注意力(Self-Attention)的技术(类似于大型语言模型背后的技术)。想象调节器有一组“耳朵”(称为注意力头)在聆听历史窗口。

  • 如果耳朵太少,它会错过历史中的重要细节。
  • 如果耳朵太多,它会不堪重负并浪费能量。

本文的重大创新:
通常,工程师只是猜测应该给 AI 多少只耳朵。本文引入了一个第一阶段步骤,进行快速、离线的数学分析。他们观察“摩擦幽灵”,并精确计算出需要多少只不同的“耳朵”才能清晰地听到记忆。

  • 第一阶段(架构师):运行快速模拟以计算所需的耳朵数量。
  • 第二阶段(学员):然后,AI 使用确切数量的耳朵进行训练,这使得训练更快、更高效。

结果:何时奏效,何时失效

作者在具有严重摩擦的双臂机器人上测试了这种方法。他们将他们的“调节器”与标准的深度学习"Transformer"模型进行了比较。

1. 短期和中期记忆(最佳区间):
当摩擦记忆较短或与调节器的历史窗口大小相匹配时,调节器的表现显著更好

  • 与标准模型相比,它将跟踪误差降低了12% 到 19%
  • 它使用更少的参数做到了这一点(它是一个更轻量、更高效的模型)。
  • 类比:这就像一位轻量级、敏捷的驾驶员,知道如何确切地聆听路况,击败了一位笨重、过度复杂的卡车司机。

2. 长期记忆(失效模式):
当摩擦记忆非常长(幽灵记得很久以前的事)时,调节器的优势消失了。

  • 在 10 次尝试中,有 4 次调节器崩溃了。它停止学习,无论负载(它携带的重量)如何,都以相同的方式驾驶。
  • 为什么? 调节器太简单了(只有一层)。那些本应聆听负载重量的“耳朵”在训练过程中被“静音”了。AI 放弃了聆听历史,只是盲目驾驶。
  • 更重、更复杂的标准模型没有经常崩溃,因为它有“备用路径”(额外的层)来保持信号活跃。

结论

这篇论文表明,对于具有隐藏记忆(如复杂摩擦)的机器人,你不需要一个巨大、复杂的 AI。你需要一个聪明、轻量级的调节器,它能观察最近的过去。

然而,你必须小心:

  1. 先数清你的耳朵:在开始训练之前,利用数学精确计算你需要多少注意力头。
  2. 警惕长期记忆:如果机器人的记忆太长,简单的调节器可能会感到困惑并放弃。你可能需要一个更复杂的备用系统来防止它“忘记”如何处理重载。

该论文总结道,虽然这种“先搜索后训练”的方法在短期和中期记忆中表现完美,但未来的工作需要使调节器具备适应性,允许它在实际驾驶过程中增长或收缩其“耳朵”,这样它就永远不会陷入困惑的状态。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →