← 最新论文
⚡ electrical engineering

Learning Input-Constrained Funnel Controllers from State Trajectory Data

本文提出了一种基于优化的框架,该框架直接从状态轨迹数据中学习输入受限的漏斗控制器(funnel controllers),从而能够在不需要专家控制输入数据或策略重构的情况下,合成能够强制执行预设性能和硬输入约束的反馈控制器。

原作者: Panagiotis S. Trakas, Omid Mirzaeedodangeh, Lars Lindemann

发布于 2026-07-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Panagiotis S. Trakas, Omid Mirzaeedodangeh, Lars Lindemann

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人如何在拥挤狭窄的走廊里行走,而不撞到墙壁或被自己的脚绊倒。在机器人技术和工程领域,这就是“控制器”的工作——它是一个大脑,告诉机器人的电机究竟要施加多大的推力。但问题在于:真实的机器人是有极限的。它们的电机在过热或损坏之前,能施加的推力是有限的(输入约束),而且它们不仅要从 A 点移动到 B 点,还要以特定的优雅度、速度和安全余量进行平滑移动(性能规范)。

长期以来,工程师们尝试通过两种方式来解决这个问题:要么猜测完美的规则(这很难,因为机器人的身体可能与蓝图略有不同),要么观察专家的动作并试图模仿其每一个动作。但如果当你只有一段专家行走的视频,却没有关于其指令的音频呢?你可以看到他们去了哪里,但你不知道他们究竟按下了按钮多大力度。这篇论文正好解决了这个难题:如何仅通过观察机器人的运动轨迹,就能教会机器人完美且安全地行走,而无需看到那些隐藏的控制代码,前提是你拥有一个粗略的蓝图(即“标称模型”)来描述机器人的运动方式。

来自苏黎世联邦理工学院(ETH Zurich)的研究人员提出了一种巧妙的新方法,通过学习“状态轨迹数据”——这只是一个术语,指记录机器人在每一时刻所处位置的数据。他们并没有尝试去逆向工程专家隐藏的按键动作(这种被称为“模仿学习”的方法在缺少按键数据时往往会失败),而是将问题视为一场“设计完美走廊”的游戏。他们想要在专家行进的路径周围画出一个虚拟的、收缩的隧道(称为“漏斗”)。这个隧道代表了一个安全区域:如果机器人保持在这个隧道内,就意味着它移动得足够快、停止得足够精准,且不会产生过度的晃动。

挑战在于,隧道的形状必须被塑造得完美无缺。如果隧道太宽,机器人就会变得懒散且缓慢;如果隧道太窄,机器人的电机可能会因为必须努力维持在内部而发出抗议的尖叫。团队开发了一个数学配方,利用记录的路径以及已知的系统蓝图,自动设计出这个隧道,并同时发明出一套新的机器人遵循规则。他们称之为“联合综合”(joint synthesis),因为他们将隧道和控制器一起构建,就像钥匙和锁一样,确保它们完美契合。

其中的奥秘在于:论文指出,你不需要知道专家的秘密指令也能学习其行为,但这仅在拥有系统的基础物理模型(“标称模型”)时才有效。 通过观察记录路径中的平滑曲线,算法可以推导出能够自然包含这些路径的“隧道形状”。然后,它会计算出一个反馈增益——一种“转向灵敏度”——告诉机器人为了留在该隧道内应施加多大的推力,即使机器人的电机达到了其最大极限。作者使用了一种名为“有效集综合”(active-set synthesis)的方法,这是一种类似于智能试错的过程。它尝试拟合隧道和转向规则,检查机器人的电机是否会卡住;如果卡住了,它会轻轻地重新塑造隧道或调整规则,直到找到一个既能尊重电机限制的解决方案。

为了证明其有效性,团队在模拟一个模仿两个相连水箱的系统中进行了测试,目标是将水位的特定高度保持在设定值。他们生成了 30 条不同的“专家”路径,使用了各种控制器,然后丢弃了秘密指令,仅将水位数据**以及系统的物理参数(标称模型)**输入到他们的新算法中。结果如何?算法成功学习了一套简单的规则,能够引导水位达到目标,严格保持在学习到的“漏斗”内,且从未要求泵的推力超过其允许范围。

这篇论文并不仅仅说“看起来有效”,它还提供了两层数学证明。第一层是“保守性”保证:如果电机足以应对最坏的情况,机器人一定会保持安全。第二层是“局部”保证:如果记录的数据足够密集(样本点非常接近),机器人保证会在记录路径附近保持安全。在他们的模拟实验中,新控制器不仅保持了水位的安全,还补偿了水箱物理模型的微小误差,而以前更简单的方法往往无法做到这一点。

最终,这项工作表明,我们可以通过观察机器人的运动,并利用其机械原理的粗略模型来填补空白,从而教会复杂的机器执行高精度且安全的任务,而无需了解其内部秘密或获取其控制输入。这是迈向让机器人仅通过观察即可学习的一步,使其能够在模仿专家优雅行为的同时,适应自身的物理极限。作者指出,虽然他们的方法很有前景,但它依赖于拥有一个良好的“标称模型”(即对系统运作方式的初步了解),且目前的数学证明是基于模拟的,这为未来在真实硬件上测试这些想法留下了空间。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →