想象一下,你拥有一个技术精湛的机器人厨师。你通过向它展示制作三明治的视频来训练它。现在,机器人已经准备好开始工作了。但突然,你改变了主意。你说:“实际上,我不要火腿了,我要火鸡肉。”或者“把三明治放在顶层架子上,而不是底层架子。”
在机器人领域,这是一个巨大的难题。通常,要改变机器人的想法,你必须停止机器人,重新教它一遍(重新训练),或者雇佣人类专家来手动重写它的脑部代码。这既慢又贵,而且不切实际。
这篇论文介绍了一种名为 ReStruct 的新方法,它让你只需通过与机器人交谈,就能瞬间引导其行为,而无需进行任何重新训练。
以下是它的工作原理,我们使用简单的类比来解释:
问题所在:改变机器人行为的两种失败方式
作者解释说,现有方法在两个特定方面会失效:
- “硬重置”法(端到端): 想象一下,你想通过逐帧编辑胶片来改变电影的情节。每当你想要一个不同的结局时,你都必须重新编辑整部电影(重新训练机器人)。这很慢,并且需要一位知道如何精准编辑的导演(专家)。
- “仅逻辑”法(神经符号化): 想象一下,你给机器人一组逻辑规则,比如“拿起杯子”和“把它放在架子上”。机器人完美地遵循了逻辑,但它可能会尝试让杯子穿过架子,因为它不理解物理规律。它掌握了正确的“词汇”,但缺乏正确的“肌肉记忆”。
解决方案:ReStruct(“重组”框架)
ReStruct 通过将机器人的大脑视为由两部分组成来解决这个问题:一个地图(高层规划)和一个驾驶员(低层肌肉控制)。
1. 地图与驾驶员
把机器人的策略想象成一次公路旅行:
- 驾驶员(低层控制器): 这是实际负责转向、踩油门和转动方向盘的部分。它知道如何进行物理移动。在 ReStruct 中,这个驾驶员是冻结的。我们不改变驾驶员;我们信任他们能开好车。
- 地图(高层骨架): 这是行程单。它说:“首先去加油站,然后去超市,最后回家。”在旧款机器人中,这张地图是僵化的。
2. 魔法技巧:重绘地图
当你提出新的偏好(例如,“在去加油站之前先去超市”)时,ReStruct 并不会要求驾驶员学习新的驾驶方式。相反,它会重绘地图。
- 步骤 A:翻译官(VLM): 你用直白的英语告诉机器人你的偏好。一个聪明的 AI 翻译器(视觉语言模型)会将你的句子转化为一套严格的规则(“状态机”)。
- 步骤 B:合并: 它将你的新规则与机器人的原始地图进行合并。它创建了一张新地图,这张地图只允许符合你新规则的路径通行。
- 步骤 C:现实检查(轨迹回放): 这是最重要的一部分。旧地图可能包含了一条在逻辑上有效但在物理上不可能实现的路径(比如开车穿墙而过)。ReStruct 会查看原始训练视频(演示数据),并询问:“在这张新地图上,哪些旧的驾驶路径实际上是行得通的?”
- 它会丢弃那些会导致撞车的路径。
- 它保留行得通的路径,并更新针对这些特定道路的“指令”给驾驶员。
3. 结果
现在,机器人拥有了一张遵循你规则的新地图,但它仍然使用的是同一个值得信赖的驾驶员。因为地图已被更新为仅包含驾驶员已知如何行驶的路径,所以机器人能够完美地遵循你的新偏好,而不会发生碰撞或需要重新训练。
为什么这很重要
论文表明,ReStruct 可以处理复杂的请求,例如:
- “拿起红色的积木,但只有在蓝色积木已经在那里时才执行。”
- “把杯子放在最高的架子上,而不是最低的架子上。”
在测试中,ReStruct 能够比目前最先进的机器人模型(如 VLA 模型)在遵循这些新规则方面表现好 25%,同时仍能成功完成主要任务。
核心结论
ReStruct 就像是给机器人驾驶员配备了一个 GPS。如果你想改变目的地,你不需要重新教驾驶员如何开车。你只需要更新 GPS 路线,以确保它建议的都是驾驶员能够驾驭的道路。这使得机器人变得更加灵活,并且更容易让普通人通过简单的语言进行控制。
技术摘要:ReStruct —— 通过任务结构的物理感知重构实现推理时机器人行为引导
1. 问题陈述
核心挑战在于解决**推理时行为引导(inference-time behavior steering)**问题:即在测试时重新定向已学习的机器人策略,以满足训练期间未预见的用户偏好,而无需重新训练或额外的数据收集。
现有方法在两种截然不同的模式下失效:
- 端到端方法(如 VLA 模型、扩散策略/Diffusion Policies): 这些方法依赖于微调或施加引导机制(例如软拉格朗日法)。它们需要专家知识,并且受限于近似可微的偏好。它们缺乏一种显式的抽象,无法将新偏好落地为可执行行为集,而不进行重新训练。
- 神经符号方法(Neuro-Symbolic Methods): 这些方法使用符号层来指定偏好。然而,它们通常依赖于预定义的符号。编辑这些符号可能会产生逻辑上有效但物理上不可行的计划,因为符号编辑并未传播到低层控制器。控制器可能会尝试执行违反物理约束(例如间隙不足)的计划,因为符号抽象与控制器的可执行行为分布是脱节的。
本文认为,鲁棒的引导需要一种**物理感知(physically-aware)**的中介表示,将每种偏好锚定在满足该偏好的控制器可执行行为子集之中。
2. 方法论:ReStruct
作者提出了构建在**涌现神经自动机策略(ENAP)**之上的 ReStruct 框架。ENAP 将视觉运动策略分解为一个高层状态机骨架(概率米利机,PMM)和一个低层连续控制器。ReStruct 通过以下三个阶段改进了该架构,以实现零样本引导:
A. 高层:符号骨架重构 (p(z∣ϕ))
给定自然语言偏好 ϕ,ReStruct 在保持低层控制器冻结的同时,重构基础策略的任务结构。
- 偏好落地(Preference Grounding): 视觉语言模型(VLM)分析偏好 ϕ 和基础骨架的聚类字母表(cluster alphabet)。
- 如果现有字母表已足够充分,VLM 将 ϕ 翻译为有限轨迹上的线性时序逻辑(LTLf)公式,并将其编译为确定性有限自动机(DFA)。
- 如果字母表缺乏粒度(例如,“拿起”需要区分“拿起红色”与“拿起蓝色”),VLM 会细化聚类并相应更新骨架拓扑结构。
- 同步积(Synchronous Product): 偏好 DFA 通过同步积与基础(或细化后的)PMM 骨架相结合。这创建了一个新的、经过引导的骨架(M2),该骨架在结构上仅允许满足偏好 ϕ 的轨迹。
B. 动作先验桥梁:轨迹重放 (pD(z∣τ))
为了确保新骨架在物理上是可行的,ReStruct 重新计算了修改后骨架的动作先验。
- 重放机制: 系统通过新的引导骨架 M2 在原始演示数据集中重放代表性轨迹。
- 过滤: 达到无效状态或在乘积自动机接受集之外终止的轨迹将被丢弃。
- 重新填充: 有效轨迹被接受,其特定的动作被写入与新骨架各条边相关的动作列表中。这弥合了编辑后的符号结构与冻结的低层网络之间的鸿沟,确保先验反映了在新约束下的物理可执行行为。
C. 低层:动作生成 (pD(τ))
低层控制器在整个引导过程中保持冻结。
- 架构: 控制器接收当前观测值以及当前激活边的动作列表(重新填充的先验)作为输入。
- 机制: 它使用注意力机制将观测值映射到列表中的原型动作,然后应用残差 MLP,根据观测值与聚类质心之间的偏移量生成修正。最终动作被限制在提供的动作列表范围内。
- 优势: 这种设计允许控制器在无需重新训练的情况下适应新的结构先验,同时保持对骨架重构引起的分布偏移的鲁棒性。
3. 核心贡献
- ReStruct 框架: 一个零样本引导框架,使学习到的策略能够遵循高层语义偏好(从以物体为中心到时序逻辑),而无需重新训练。它允许普通用户通过语言重塑机器人行为。
- 物理感知引导: 通过在重构的骨架上通过轨迹重放重新计算动作先验,该方法确保了符号编辑能传播到控制器层面,避免了物理不可行的计划。
- 可解释性与可验证性: 状态机结构和基于原型的动作先验使得偏好满足情况可以在符号级和控制级同时被检查。
- 数据效率: 该框架通过在相关但不同的任务中注入偏好,利用多样化演示中的经验来实现跨任务适应,从而合成目标任务的行为。
4. 实验结果
作者在模拟环境(ManiSkill, Calvin)和真实世界(Kinova Gen3)环境中评估了 ReStruct,任务涵盖从复杂操纵到长时程时序动作与运动规划(TAMP)的各种场景。
- 偏好遵循 vs. 任务成功率: ReStruct 在成功率(SR)和偏好下的成功率(SRP)方面均一致优于基准方法(包括 VLA 模型如 OpenVLA 和 π0.5,以及扩散策略)。
- 在复杂操纵任务(如 SeqPushT, PegInsert)中,ReStruct 在保持或提高任务成功率的同时,比 VLA 模型在偏好遵循方面提升了高达 25%。
- 与拒绝过滤基准(以牺牲 SR 来换取 SRP)或提示词注入基准(维持 SR 但无法满足 SRP)不同,ReStruct 在这两个指标上都取得了高分。
- 长时程适应: 在长时程任务(如 Causal 和 Unconstrained 技能集)中,ReStruct 成功地从无序的演示数据中恢复了有序序列,表现优于微调后的 VLA 基准。
- 鲁棒性: 在真实世界实验(CanSorting, PassTeaPot, ConeCover)中,ReStruct 实现了近乎完美的 SRP(通常为 100%),而 VLA 基准在此处显著下降(例如降至 ~30-40%)。
- 消融实验: 去除轨迹重放步骤或注意力/钳制(clamp)机制会显著降低性能,证实了重新建立动作先验落地和灵活控制器设计的必要性。
5. 重要性与主张
本文声称 ReStruct 提供了一条路径,让普通用户能够通过语言而非重新训练来重塑他们的机器人。通过通过动作先验保持物理联系,将符号任务结构与低层控制器解耦,该方法实现了一种纯符号或纯端到端方法所缺乏的“果断性”和物理可行性。
作者将 ReStruct 定位为解决当前部署方法结构性局限性的方案:它避免了重新优化(与训练时方法不同),并确保符号编辑能可靠地传播到可执行行为(与传统的神经符号路由不同)。这项工作证明了推理时引导可以既是可解释的(通过自动机)又是物理落地的(通过重放的先验),从而在复杂的现实世界操纵场景中实现对用户偏好的鲁棒适应。
承认的局限性:
- 该方法依赖于 ENAP 后端;将其他策略类扩展到 ENAP 需要进行策略蒸馏,这目前存在性能差距。
- 引导的质量取决于 VLM 生成正确 LTL 公式的能力;对于复杂情况可能需要迭代优化。
- 可引导范围目前局限于域内及组合式域外(OOD)偏好;扩展到更丰富的 OOD 范式并诱导出全新的技能仍是一个开放性挑战。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。