← 最新论文
💻 computer science

Beyond Implicit Force: Evaluating Explicit Force-Torque Proxies in Action Chunking with Transformers

本文表明,虽然基于 Transformer 的动作分块(ACT)通常依赖于隐式的遥操作追踪误差来实现富接触操控,但利用来自车载传感器的显式关节力矩代理值来替换这些隐藏线索,可以有效地恢复甚至增强在多种现实世界任务中的力觉感知行为。

原作者: King Hang Wong, Lingqiao Liu, Feras Dayoub

发布于 2026-07-17
📖 1 分钟阅读☕ 轻松阅读

原作者: King Hang Wong, Lingqiao Liu, Feras Dayoub

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人做一些精细的家务,比如擦桌子或插充电器。你不能只给机器人看一段视频;它需要“感觉到”自己在做什么。但机器人没有皮肤,摄像头也看不见“压力”或“摩擦力”。这就是**接触密集型操控(contact-rich manipulation)的复杂世界——在这种情况下,机器人必须与物理世界互动,既不能损坏物品,也不能卡住。为了教导机器人,科学家们经常使用一种叫做模仿学习(Imitation Learning)**的方法,即让机器人观察人类完成任务并尝试模仿人类。一个流行的工具叫做 ACT(基于 Transformer 的动作分块技术),它就像一个超级聪明的预测器,能够一次性预测机器人接下来的几个动作,而不是一步步地进行。大家都在问的一个大问题是:如果机器人无法真正“感觉”到物体,它怎么知道什么时候该用力推,或者什么时候该退后?它是需要昂贵且专门的传感器,还是仅仅通过观察就能掌握?

这篇论文深入探讨了我们在教导机器人时隐藏的一个惊人秘密。研究人员发现,流行的 ACT 机器人实际上在“作弊”一点点。当人类使用一种特殊的“主从控制”(leader-follower)设置(即人类移动主臂,机器人模仿其动作带动从臂)来教导这些机器人时,机器人不仅仅是在复制手臂的位置。它其实在秘密地从“挣扎”中学习。如果机器人的手臂撞到了墙,导致无法像人类手臂那样移动得那么快,那种微小的滞后或“跟踪误差”就变成了一个隐藏信号,告诉机器人:“嘿,有东西挡路了,再使点劲!”这篇论文提出了一个问题:如果我们拿走了那个隐藏的“挣扎”信号,会发生什么?机器人会忘记如何处理接触吗?

为了找出答案,作者构建了一个忽略人类“挣扎”并仅预测机器人自身手臂应该去向何处的机器人版本。他们将其称为 ACT-o。当他们在擦黑板、插充电器或按压软瓶子等现实世界的任务中测试它时,机器人完全崩溃了。失去了那个隐藏的“滞后”信号,机器人变得犹豫不决、僵住,或者只是在物体上方悬停,无法施加必要的力。这就像一位音乐家虽然能弹奏出音符,却忘了如何用力按下琴键以发出声音。

然而,故事并没有以失败告终。研究人员随后尝试了一个简单的修复方法:利用机器人已经拥有的数据赋予它一种新的感知能力。他们没有使用昂贵的外部传感器,而是使用了机器人自身的电机电流(即电机正在消耗多少电量)作为“扭矩代理”——即对机器人施加了多少力的粗略估计。当他们将这种简单的“力感”反馈给机器人时,它重新焕发了生机。机器人突然能够区分硬表面和软表面,能在触碰到泡沫块时准确停止,甚至能进行轻柔的“轻敲”以对准插头。

这篇论文表明,虽然旧有的教学方法中隐藏的“挣扎”是一个强大的、偶然的老师,但我们不再需要依赖它了。通过简单地将基础的力估计(源自电机电流)加入机器人的大脑,我们可以让它在处理接触方面变得和以前一样好,甚至更好。这意味着即使是在没有高级、昂贵力传感器的廉价硬件上,只要我们能让机器人“感觉到”自身电机的运作,我们就能教会它们完成精细且对力敏感的工作。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →