← 最新论文
🤖 AI

CASD: Chunk-Aligned Semantic Distillation for Multi-StageRobot Manipulation

本文介绍了块对齐语义蒸馏(Chunk-Aligned Semantic Distillation, CASD),该方法利用离线视觉-语言模型为整个动作块生成语义目标,从而使冻结的生成器能够引导机器人策略,并与现有方法相比,在多个操作基准测试中显著提高了成功率。

原作者: Tinghe Ding, Jiahao Li, He Wang

发布于 2026-09-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Tinghe Ding, Jiahao Li, He Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

能够在现实世界中操纵物体的机器人面临着一个根本性的时间问题。当人类要求机器人“把碗放入抽屉并关上它”时,这个指令听起来像是一个单一的命令,但在物理现实中,它是一个由不同时刻组成的序列:伸手拿碗、抓取、移动、释放,最后推上抽屉。现代机器人通常试图通过一次性预测一小块未来的动作序列来解决这个问题,这种技术有助于它们在不需要在每个微小动作后都停下来思考的情况下实现流畅运动。然而,这种方法产生了一个盲点。如果机器人预测了一个包含二十个动作的动作块,而该块的中部恰好是它从“持握碗”切换到“放开碗”的精确时刻,机器人的内部引导可能仍会告诉它要“持握”,因为那是该动作块前半部分的指令。它未能意识到目标已经发生了转变,从而导致笨拙或失败的操作。

为了解决这个问题,蚂蚁集团的研究人员开发了一种名为“块对齐语义蒸馏”(Chunk-Aligned Semantic Distillation)的方法。其核心思想是教会机器人不仅要理解它现在正在做什么,还要准确理解它即将进行的动作块中有多少比例属于任务的各个部分。机器人不再被强制要求为整个时间块选择一个单一的标签(如“移动”或“关闭”),系统会计算一个加权混合值。如果一个动作块中有四分之三是在“移动”,四分之一是在“释放”,机器人就会学习为两者的结合做好准备。这使得机器人能够在步骤之间平滑过渡,在变化发生前进行预判,而不是在发生后才做出反应。

研究人员通过一个将“思考”与“执行”分离的两步训练过程构建了这个系统。首先,他们使用了一个强大的离线语言模型来观察人类执行任务的录像。该模型充当“老师”,将每段视频分解成不同的阶段时间轴,例如“抓取”、“运输”和“释放”。对于视频中的每一个时刻,老师都会计算机器人在接下来的动作块中将在每个阶段停留的确切时间。随后,它会创建一个语义目标——即对未来阶段混合情况的描述——作为该时刻的正确答案。

接下来,他们训练了一个单独的计算机程序(称为生成器),使其仅凭机器人摄像头的当前视角、自身的物理状态以及文本指令,就能预测出这种未来的混合情况。生成器学会了观察当下并猜测即刻未来的构成。一旦这个生成器训练完成,研究人员就冻结了它的参数,使其不再发生改变。然后,他们将这个冻结的生成器连接到主要的机器人策略上。现在,每当机器人需要决定做什么时,生成器都会立即提供一个语义上下文标记(semantic context token),用以描述即将到来的阶段混合情况。机器人利用这个标记来引导其运动,从而有效地在转变发生前就预见到它。至关重要的是,整个过程并不需要机器人在工作时调用大型语言模型或生成文本;理解任务结构的繁重工作已在预先完成并存储在冻结的生成器中。

团队在多种不同的机器人学习系统和各种基准测试上测试了这种方法,包括涉及单臂、双臂协作以及复杂导航场景的任务。在标准测试中,该方法表现出了明显的改进。当与一种被称为“联合模型”(Joint model)的特定机器人大脑结合时,在一组操纵任务上的成功率从 98.0% 提升到了 98.9%。在另一组双手动作任务中,提升更为显著,从 90.6% 跳升至 93.0%。该系统在环境变化(如光照变化或机器人起始位置改变)时也表现出了鲁棒性,在其他方法难以应对的情况下仍保持了较高的成功率。

然而,该方法并非对所有类型的机器人大脑都是普适性的胜利。当研究人员将其应用于该系统的另一种变体时,性能反而略有下降。这表明,这种语义引导的益处在很大程度上取决于机器人底层系统的构建方式;对于某些架构,额外的上下文有助于精细化动作,而对于另一些架构,它可能会引入轻微的不匹配。

测试中的一个具体案例说明了这种方法的差异。在一个机器人必须将黑色碗移入抽屉并关上抽屉的任务中,标准的机器人模型未能及时释放碗,在应该放手之后仍长时间抓着碗,最终超时失败。配备了新方法的机器人,在从完全相同的起始位置和使用相同的随机种子的情况下,更早地识别到了任务的转变。它在转换发生的精确时刻开始释放碗,顺利完成了任务。该系统不需要在还拿着碗的时候去“思考”抽屉把手,因为它接收到的语义标记已经告诉它,“释放”阶段正占据其近期未来的显著部分。

研究人员强调,这种方法并不要求机器人在移动时生成逐步计划或子目标列表。相反,它依赖于一种每决策周期生成一次的、关于任务结构的压缩数学表示。这保持了系统的高效与快速,避免了复杂推理过程带来的延迟。该方法成功地弥合了任务的高层描述与物理动作的低层时序之间的鸿沟,使机器人能够以模仿人类预判的方式,流畅地处理多阶段指令。虽然这项技术并非适用于所有机器人配置的“万能钥匙”,但它提供了一种具体的方法,通过改善机器对自身运动中时间流逝的理解,将僵化的命令序列转化为动态且具备上下文感知能力的表现。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →