← 最新论文
💻 computer science

Why Does Action Chunking Improve Behavioral Cloning Performance in Robotic Control?

本文揭示了动作分块(action chunking)主要通过对多样化时间关系的“隐式集成”而非此前假设的因素来提升机器人控制性能,并证明了在无需进行动作分块的情况下,通过显式部署延迟策略的集成,亦可以取得相当或更优的结果。

原作者: Filippo Lazzati, Kyle Stachowicz, William Chen, Alberto Maria Metelli, Andrew Wagenmaker, Sergey Levine

发布于 2026-08-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Filippo Lazzati, Kyle Stachowicz, William Chen, Alberto Maria Metelli, Andrew Wagenmaker, Sergey Levine

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一个机器人完成一项复杂的任务,比如做三明治或打开抽屉,方法是观察人类是如何做的。这个领域被称为模仿学习(Imitation Learning),更具体地说,是行为克隆(Behavioral Cloning)。这就像是一个学生在模仿老师做作业。机器人观察人类移动手臂的视频,并试图学习其中的规则,以便将来能独立完成同样的操作。

这里面临的一个巨大挑战是,世界是混乱的。如果机器人犯了一个微小的错误,下一刻的情况可能与它在训练视频中看到的情况完全不同。这就像是在走钢丝;如果你踉跄了一下,可能会彻底跌落出路径。为了应对这个问题,科学家们经常使用一种被称为**动作分块(Action Chunking)**的小技巧。与其告诉机器人“将手向前移动一英寸”,然后等待看到结果后再给出下一个指令,不如一次性告诉它“将手向前移动一英寸,然后再移动一英寸,再移动一英寸”。这就像是给机器人一整句指令,而不是仅仅一个单词。这曾是让机器人表现出色的秘诀,但以前没人确切知道为什么它比一次只给一个指令的效果要好得多。

这篇论文深入探讨了这个谜团。作者们是一支来自加州大学伯克利分校和米兰理工大学等研究机构的研究团队,他们决定扮演侦探的角色。他们想知道:是因为机器人变得更加一致了吗?是因为它看得更远了吗?还是完全出于其他原因?他们在计算机模拟中进行了数百次实验,甚至在实验室里的真实机器人上进行了测试,以寻找动作分块背是否真的如此神奇的真相。

伟大的“为什么”调查

长期以来,人们一直认为给机器人一个“动作块”之所以有帮助,主要有三个原因:

  1. 时间一致性(Temporal Consistency): 即人类的动作是平滑的,而分块有助于机器人更好地模仿这种平滑性,而不是那种只考虑一步的机器人。
  2. 时界缩减(Horizon Reduction): 即通过规划未来几步,机器人不必担心过于遥远的未来可能出错,从而降低了迷失方向的概率。
  3. 表示学习(Representation Learning): 即尝试预测一整串动作有助于机器人的“大脑”学习到更好的“特征”,从而让它整体变得更聪明。

作者们着手测试这些想法。他们构建了一种特殊的机器人策略(一套控制机器人行为的规则),这种策略可以一次性预测包含 20 个动作的动作块。接着,他们创建了一个“延迟(delayed)”版本的策略。延迟策略有点像是一个会根据 5 秒或 10 秒前的观察结果来决定现在该做什么的机器人。它并不预测整个未来的序列,它只是预测紧接着的下一步,但它是基于一个过往的观察结果来进行预测。

转折点: 当他们测试这些想法时,发现前两个流行的理论其实是错误的,或者至少并不完整。

  • 他们发现,时间一致性并不是主角。一个仅仅观察过去的机器人(延迟策略)同样可以完美地模仿人类的平滑动作,其表现与预测整个动作块的机器人不相上下。
  • 他们还发现,时界缩减也不是主要原因。虽然预测一个动作块确实减少了“时界”(即机器人规划的未来距离),但一个延迟策略也可以在不进行整段序列规划的情况下实现同样的误差缩减。

那么,如果这些著名的理论都不是答案,真正的答案又是什么呢?

真正的秘密:“隐式集成”

论文揭示了动作分块真正的超能力,作者称之为隐式集成(Implicit Ensembling)。

想象一下你在尝试预测天气。你可以问一位每小时看一次窗外的朋友。或者,你可以问五位在不同时间看窗外的朋友:一位在 9:00 看,一位在 9:05 看,一位在 9:10 看,依此类推。即使他们看的是同一片天空,他们不同的视角也可能帮助你做出更好的判断。

这正是动作分块机器人所做的事情。当它学习预测一个包含 20 个动作的序列时,它实际上是在同时学习 20 种不同的问题的“视角”。

  • 为了预测序列中的第一个动作,它观察当前的观测值。
  • 为了预测第二个动作,它观察当前的观测值(但想象自己处于未来的一步)。
  • 为了预测第三个动作,它观察当前的观测值(想象自己处于未来的两步)。

通过同时在所有这些不同的时间偏移关系上进行训练,机器人实际上在其大脑内部构建了一个专家团队。这就像拥有一个由 20 个不同机器人组成的委员会,每个机器人在看待世界时都有略微不同的“延迟”,它们共同投票决定下一步该做什么。这种“委员会”效应使机器人更加稳健,不太容易犯傻。

“顿悟”时刻与新方案

这篇论文最令人兴奋的部分在于他们利用这一发现做了什么。既然他们意识到神奇之处不在于“动作块”本身,而在于动作块创造了这个不同时间视角的“委员会”,于是他们问道:我们能否在完全不使用动作块的情况下获得同样的好处?

他们尝试了一个聪明的技巧,叫做随机延迟集成(Randomized Delay Ensembles)。他们没有训练一个预测动作块的机器人,而是训练了一组机器人。这组中的每个机器人都是一个“延迟”策略,但它们被训练去观察具有不同延迟的过去(一个看 1 步前,一个看 2 步前,一个看 3 步前,等等)。当需要行动时,它们不仅仅是选择一个机器人,而是从这组机器人中随机挑选一个来做出决策。

结果令人惊叹。在他们的模拟实验和现实世界测试中(例如把胡萝卜放入碗中或从烤面包机中取出面包),这个“随机延迟”团队的表现与传统的动作分块机器人一样出色。在某些情况下,它的表现甚至更好!

这对未来意味着什么

论文表明,我们并不一定需要强迫机器人去预测长序列的动作才能让它们变得聪明。所谓的“动作块”只是一个方便的手段,让我们无意中创造了一个专家团队。通过使用不同的时间延迟来显式地构建那个团队,我们可以获得相同(甚至更好)的结果。

这并不意味着动作分块是没用的;它只是意味着我们现在理解了它为什么有效。这就像意识到汽车引擎之所以工作,不是因为车漆的颜色,而是因为火花塞。现在我们知道了火花塞(集成效应)才是关键,我们就可以制造出不需要厚重、复杂的“车漆”(长动作块)也能高速运转的更好引擎。

作者证明了,在机器人混乱的现实世界中,从不同的角度观察过去是学习的一种强大方式。他们在包含 90 个任务的计算机模拟以及真实机器人的物理任务中证明了这一点。虽然他们不能保证这能解决世界上所有的机器人问题,但他们的实验强烈暗示,机器人学习的未来可能不在于预测遥远的未来,而在于构建一个多样化的、“穿越时空”的专家团队,来决定当下该做什么。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →