想象一下,你正在尝试教一个机器人完成精细的任务,比如折叠围巾、按按钮或洗手。为了做到这一点,机器人需要“看见”世界、“感知”触摸到的物体,并“听从”你的指令。
这篇论文介绍了一种全新的机器人大脑,叫做 DAM-VLA。以下是关于它为何被开发以及它是如何运作的简单故事,我们使用了日常生活的类比。
问题所在:“一刀切”的时钟
大多数目前的机器人大脑就像一个严厉的管弦乐团指挥,强迫每一位乐手都必须以完全相同的速度演奏。
- 眼睛(视觉): 机器人的摄像头看到的世界变化是缓慢的。这就像看电影一样;场景并不会每毫秒都发生变化。
- 双手(力觉/触觉): 机器人的传感器感知压力和接触。这些变化极其迅速——就像每秒钟发生数百次的鼓点。如果你错过了一个节拍,你可能会压碎一个鸡蛋,或者在肥皂上打滑。
- 耳朵(语言): 指令(“洗手”)在整个过程中保持不变。
不匹配之处: 目前的机器人模型强迫所有这些不同的感官以相同的慢速(类似于摄像头的速度)进行更新。
- 结果: 机器人被重复的视觉信息所过载(它刚刚才看到的视觉信息就在一瞬间前出现,这浪费了能量),但它对突然的触摸或滑动却反应太慢。这就像是试图用一副沉重的、慢动作眼镜去捕捉一颗飞行的子弹。
解决方案:DAM-VLA(“解耦”的大脑)
作者提出了一种思考机器人大脑的新方式:让每种感官都按照其自身的自然时钟运行。
把 DAM-VLA 想象成一个聪明的厨房团队,而不是一个人试图同时做所有事情:
- 视觉主厨(稳健且缓慢): 这个团队成员只在场景真正发生变化时,才会更新对房间的“心理地图”。他们不需要每毫秒都大声报告更新。
- 触觉助手(快速且反应敏捷): 这个成员处于高度戒备状态,每秒钟感受数百次振动和压力变化。如果感觉不对,他们会立即大声提醒。
- 经理(动作头): 这是实际移动机器人手臂的部分。经理不需要等待视觉主厨完成缓慢的报告后再行动,而是会持续倾听触觉助手进行即时安全检查,同时将视觉主厨的地图放在随身口袋里。
它是如何运作的(神奇的技巧)
论文强调了使这一切得以实现的三个“技巧”:
独立的笔记本(潜变量缓冲区/Latent Buffers):
与其使用一个所有人同时在上面书写的巨大笔记本,不如让每种感官都有自己的笔记本。摄像头每 4 秒写一页新内容;力传感器每毫秒写一行。机器人的大脑可以在需要时随时阅读这些笔记本中的任何一个,而无需等待其他感官跟上进度。
“智能门控”(门控交叉注意力/Gated Cross-Attention):
机器人如何在不产生混乱的情况下混合这些不同的速度?想象一下夜总会的保镖。
- 当机器人在环顾四周时,“视觉门”是打开的,允许视觉记忆进入。
- 当机器人触摸到物体时,“力觉门”会瞬间开启,让压力数据进入。
- 至关重要的是,这个门是智能的。它知道何时该允许信息进入,何时该忽略信息,因此机器人不会被噪声淹没。它将新信息作为对计划的“修正”,而不是从头开始重写整个计划。
- 不再“结巴”:
旧的机器人会因为等待缓慢的摄像头更新来决定下一步行动而导致停顿或抽搐。DAM-VLA 以 100 次/秒(100 Hz)的速度流畅运行,在理解大局的同时,能对触摸做出即时反应。
结果:它真的有效吗?
研究人员在 7 个现实世界的任务上测试了它,这些任务需要机器人触摸物体(例如折叠围巾、擦拭白板或插入乐高积木)。
- 旧方法(同步式): 最好的以往机器人仅能成功 41% 的次数。它经常在需要精确触觉的任务(如按按钮或洗手)中失败,要么没按准目标,要么压碎了目标。
- 新方法 (DAM-VLA): 新机器人成功率达到了 95%。
- 它不仅在简单的任务上表现更好,还掌握了旧机器人完全无法胜任的、需要高强度接触的困难任务。
- 它的动作流畅且快速,没有旧模型那种僵硬、犹豫的动作。
核心结论
论文声称,通过停止让机器人强迫所有感官都随着同一个缓慢的鼓点前进,转而让每种感官跳各自的舞,我们得到了一个更可靠、更快、且更擅长处理精细物理任务的机器人。
简而言之: DAM-VLA 是一个终于理解了“观察房间”与“感受触摸”发生在不同速度下的机器人大脑,并且它构建决策过程的方式尊重了这种差异。
技术摘要:DAM-VLA(解耦异步多模态视觉语言动作模型)
1. 问题陈述
当前的视觉-语言-动作(VLA)模型继承了其视觉-语言预训练基础中的同步处理时钟。在这些模型中,所有传感器模态(视觉、力/力矩、本体感受、语言)都在单一的、固定的时间步长下进行编码和处理。作者认为这种架构与物理机器人交互存在根本性的失配,因为传感器的运行速率和时间跨度截然不同:
- 速率失配: 高频信号(例如 100–500 Hz 的力/力矩信号)被欠采样,而慢速信号(例如 3–10 Hz 的 RGB 视觉)则被过度采样。
- 时间跨度失配: 快速信号(接触瞬态)在毫秒级别内具有相关性,而场景布局在秒级内保持稳定。同步模型无法尊重这些不同的时间跨度。
- 延迟与冗余: 同步架构迫使昂贵的 VLM 编码器在每一步都重新处理语义上完全相同的帧,从而浪费计算资源。此外,动作生成的速率受限于最慢模态的到达,这限制了有效控制频率并增加了延迟。
论文指出,将异构传感器强制整合进统一的 token 流会导致冗余计算、跨模态速率失配以及高推理延迟,最终限制了其在富接触操作任务中的表现。
2. 方法论:DAM-VLA 架构
作者提出了 DAM-VLA,一种解耦的异步架构,旨在按照每个模态的自然传感器速率进行处理,同时维持一个连续的控制循环。
核心架构原则
单模态潜在缓冲区(Per-Modality Latent Buffers): DAM-VLA 不使用单一的同步观测包,而是为每个模态维护独立的潜在缓冲区(Zm)。
- 视觉: 定期进行编码(例如每 4 个推理步一次),以避免对静态场景进行冗余处理。通过维护一个近期视觉嵌入的滚动缓冲区来保留稀疏更新之间的上下文。
- 高频模态(力/本体感受): 以全控制频率(例如 100 Hz)进行更新。力信号通过指数移动平均进行平滑,并通过门控循环单元(GRU)进行编码,随后压缩为潜在 token 序列。
- 语言: 在每个回合(episode)中作为静态指令编码一次。
连续动作头(Continuous Action Head): 动作头以控制频率(例如 100 Hz)持续从所有潜在缓冲区中读取信息。它不会被任何单一模态的更新周期所阻塞。如果某个模态尚未更新,则重复使用缓存的潜在表示。
门控交叉注意力(Gated Cross-Attention, GCA)集成: 为了在不破坏预训练 VLM 主干网络的情况下集成新的高频模态,DAM-VLA 避免了朴素的 token 拼接。相反,它在特定的 Transformer 块中插入了并行的 GCA 通路:
- 视觉记忆通路: 使用全局门控(零初始化的标量)将压缩的视觉记忆 token 作为残差注入。这使得模型能够逐渐学习使用视觉上下文,而不破坏预训练权重。
- 附加模态通路(如力): 使用基于均值池化力 token 的输入依赖型门控(Sigmoid 函数)。这使得网络能够学习在何时(例如发生接触时)力信号是具有信息量的,而无需显式的接触检测。
- 正交性: 力通路在记忆更新之前查询动作 token,确保力信号提供的是纯粹的加性增量(additive delta),并防止跨模态纠缠。
训练与推理
- 训练: 各模态被对齐到统一的时间线进行动作标注,但视觉观测通过步长采样以模拟稀疏的传感器速率,而力信号则是连续采样的。
- 推理: 系统异步运行。视觉更新是稀疏的,而力与本体感受在每个控制步都会更新。动作头持续读取来自所有缓冲区的最新可用 token。
3. 核心贡献
- 异步多模态架构: 引入了一种解耦设计,使每个模态都能在其自然的传感器速率下更新并保留信息,且每个模态的时间上下文窗口都与其信号的意义跨度相匹配。
- 通过异步表示提升性能: 证明了保留传感器的自然信息结构所产生的多模态表示,在任务成功率上显著优于同步基线模型。
- 降低推理延迟: 通过将动作生成与慢速模态更新周期(如周期性的 VLM 重编码)解耦,策略可以在高控制频率(100 Hz)下连续行动,从而降低了端到端延迟。
4. 实验结果
作者在 七个富接触真实世界操作任务(围巾折叠、白板清洁、按按钮、洗手、插座插入、扫地、乐高拼搭)上评估了 DAM-VLA,使用的是 Franka Emika Panda 机械臂。其主干网络为 X-VLA。
- 性能提升: DAM-VLA 实现了 95.2% 的平均成功率,比最强的同步基线(X-VLA25,为 40.95%)提高了一倍以上。
- 频率缩放: 朴素的频率缩放(在不进行解耦的情况下将视觉上采样至 100 Hz,即 X-VLA100)使性能下降至 21.9%,证实了仅靠提高频率是不够的,甚至由于冗余帧偏差可能是有害的。
- 消融实验:
- 仅解耦(DAM-VLA/F/M): 恢复了因朴素缩放而损失的性能(40.0% vs 21.9%),证明了异步处理的架构优势。
- 模态贡献: 单独添加力(DAM-VLA/F)或视觉记忆(DAM-VLA/M)都能在解耦基线之上提升性能。结合两者的完整模型达到了最高成功率。
- 集成机制: 使用 token 拼接的基线(X-VLAAF M)仅达到了 54.3%,显著低于 DAM-VLA 的 95.2%。这凸显了 门控交叉注意力(Gated Cross-Attention) 机制对于在不破坏预训练表示的情况下集成新模态至关重要。
- 控制平滑度: DAM-VLA 在 100 Hz 下保持了平滑且具反应性的控制,而同步基线在高频下会出现运动抖动或执行崩溃。
5. 意义与声明
论文声称,针对每个模态进行解耦的时间处理,是比继承自语言预训练的同步时钟更优越的多模态机器人学习架构原则。
- 实际价值: 结果表明,让每个传感器按其自身的速率更新,而不是强行采用共享速率,是构建鲁棒操作策略(特别是对于需要精确接触和高反应能力的任务)的一种切实可行的方法。
- 效率: 该方法消除了针对慢速模态的冗余计算,同时捕捉了高频传感器的快速动力学特性。
- 对局限性的坦诚: 作者承认 DAM-VLA 目前仅利用力来构建表示,而没有利用它来“修正”动作块内的行为(这限制了其在对对齐极其敏感的任务,如插座插入上的表现)。他们还指出,视觉侧仅是部分解耦(基于计时器而非基于事件)。未来的工作旨在利用力进行中段(mid-chunk)修正,并根据场景变化触发 VLM 更新。
总之,DAM-VLA 通过引入一种尊重物理传感器特性的异步解耦架构,解决了 VLA 模型中的“同步失配”问题,从而实现了更高的成功率和更平滑的真实世界操作控制。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。