← 最新论文
🤖 machine learning

DAM-VLA: Decoupled Asynchronous Multimodal Vision Language Action model

该论文介绍了 DAM-VLA,一种解耦的异步视觉-语言-动作模型,它以各模态的原生传感器频率进行处理,以克服同步架构的频率限制,在保持 100 Hz 反应式控制的同时,在接触密集型真实世界操纵任务上的成功率超过了强基准模型两倍以上。

原作者: Pankhuri Vanjani, Zhuoyue Li, Jakub Suliga, Moritz Reuss, Gianluca Geraci, Xinkai Jiang, Rudolf Lioutikov

发布于 2026-06-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Pankhuri Vanjani, Zhuoyue Li, Jakub Suliga, Moritz Reuss, Gianluca Geraci, Xinkai Jiang, Rudolf Lioutikov

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试教一个机器人完成精细的任务,比如折叠围巾、按按钮或洗手。为了做到这一点,机器人需要“看见”世界、“感知”触摸到的物体,并“听从”你的指令。

这篇论文介绍了一种全新的机器人大脑,叫做 DAM-VLA。以下是关于它为何被开发以及它是如何运作的简单故事,我们使用了日常生活的类比。

问题所在:“一刀切”的时钟

大多数目前的机器人大脑就像一个严厉的管弦乐团指挥,强迫每一位乐手都必须以完全相同的速度演奏。

  • 眼睛(视觉): 机器人的摄像头看到的世界变化是缓慢的。这就像看电影一样;场景并不会每毫秒都发生变化。
  • 双手(力觉/触觉): 机器人的传感器感知压力和接触。这些变化极其迅速——就像每秒钟发生数百次的鼓点。如果你错过了一个节拍,你可能会压碎一个鸡蛋,或者在肥皂上打滑。
  • 耳朵(语言): 指令(“洗手”)在整个过程中保持不变。

不匹配之处: 目前的机器人模型强迫所有这些不同的感官以相同的慢速(类似于摄像头的速度)进行更新。

  • 结果: 机器人被重复的视觉信息所过载(它刚刚才看到的视觉信息就在一瞬间前出现,这浪费了能量),但它对突然的触摸或滑动却反应太慢。这就像是试图用一副沉重的、慢动作眼镜去捕捉一颗飞行的子弹。

解决方案:DAM-VLA(“解耦”的大脑)

作者提出了一种思考机器人大脑的新方式:让每种感官都按照其自身的自然时钟运行。

把 DAM-VLA 想象成一个聪明的厨房团队,而不是一个人试图同时做所有事情:

  1. 视觉主厨(稳健且缓慢): 这个团队成员只在场景真正发生变化时,才会更新对房间的“心理地图”。他们不需要每毫秒都大声报告更新。
  2. 触觉助手(快速且反应敏捷): 这个成员处于高度戒备状态,每秒钟感受数百次振动和压力变化。如果感觉不对,他们会立即大声提醒。
  3. 经理(动作头): 这是实际移动机器人手臂的部分。经理不需要等待视觉主厨完成缓慢的报告后再行动,而是会持续倾听触觉助手进行即时安全检查,同时将视觉主厨的地图放在随身口袋里。

它是如何运作的(神奇的技巧)

论文强调了使这一切得以实现的三个“技巧”:

  1. 独立的笔记本(潜变量缓冲区/Latent Buffers):
    与其使用一个所有人同时在上面书写的巨大笔记本,不如让每种感官都有自己的笔记本。摄像头每 4 秒写一页新内容;力传感器每毫秒写一行。机器人的大脑可以在需要时随时阅读这些笔记本中的任何一个,而无需等待其他感官跟上进度。

  2. “智能门控”(门控交叉注意力/Gated Cross-Attention):
    机器人如何在不产生混乱的情况下混合这些不同的速度?想象一下夜总会的保镖。

  • 当机器人在环顾四周时,“视觉门”是打开的,允许视觉记忆进入。
  • 当机器人触摸到物体时,“力觉门”会瞬间开启,让压力数据进入。
  • 至关重要的是,这个门是智能的。它知道何时该允许信息进入,何时该忽略信息,因此机器人不会被噪声淹没。它将新信息作为对计划的“修正”,而不是从头开始重写整个计划。
  1. 不再“结巴”:
    旧的机器人会因为等待缓慢的摄像头更新来决定下一步行动而导致停顿或抽搐。DAM-VLA 以 100 次/秒(100 Hz)的速度流畅运行,在理解大局的同时,能对触摸做出即时反应。

结果:它真的有效吗?

研究人员在 7 个现实世界的任务上测试了它,这些任务需要机器人触摸物体(例如折叠围巾、擦拭白板或插入乐高积木)。

  • 旧方法(同步式): 最好的以往机器人仅能成功 41% 的次数。它经常在需要精确触觉的任务(如按按钮或洗手)中失败,要么没按准目标,要么压碎了目标。
  • 新方法 (DAM-VLA): 新机器人成功率达到了 95%
    • 它不仅在简单的任务上表现更好,还掌握了旧机器人完全无法胜任的、需要高强度接触的困难任务。
    • 它的动作流畅且快速,没有旧模型那种僵硬、犹豫的动作。

核心结论

论文声称,通过停止让机器人强迫所有感官都随着同一个缓慢的鼓点前进,转而让每种感官跳各自的舞,我们得到了一个更可靠、更快、且更擅长处理精细物理任务的机器人。

简而言之: DAM-VLA 是一个终于理解了“观察房间”与“感受触摸”发生在不同速度下的机器人大脑,并且它构建决策过程的方式尊重了这种差异。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →