想象一下你正在教一个机器人做一道复杂的菜。你给它一个食谱(指令),它观察着厨房台面(视觉)。但问题在于,大多数目前的机器人大脑会忽略它们手臂的位置、抓握的力量有多重,或者关节是否疲劳。它们只看图片并阅读文本,然后凭直觉猜测该做什么。
这篇名为“Think Proprioceptively”(具身感知思考)的论文介绍了一种全新的机器人思考方式,称为 ThinkProprio。它认为,为了让机器人真正理解一项任务,它需要在观察世界的同时“感受”自己的身体,而不仅仅是在决定好动作之后再去了解身体状态。
以下是它的工作原理,使用了简单的类比:
1. 问题所在:“迟到的客人”
在大多数机器人系统中,机器人的身体数据(称为本体感受——比如知道自己的手肘弯曲或手指张开)被当作一个在派对主谈话开始后才赶到的“客人”。
- 旧方式: 机器人观察图像,阅读指令,制定计划,然后才问:“噢,我的手现在在哪里?”这太晚了。等到它检查身体时,它可能已经抓错了物体或移动得太远了。
- 结果: 机器人反应迟钝且容易出错,因为它在思考任务时并没有在“感受”任务。
2. 解决方案:“将身体文本化”
ThinkProprio 通过在最开始阶段就将机器人的身体数据转化为文本标记(就像句子中的单词一样)来改变游戏规则。
- 类比: 想象你正在读一个故事。通常,你会阅读情节(指令)并观察插图(视觉)。ThinkProprio 在书的第一页就加入了一个新句子,写着:“英雄的手臂目前抬起,且抓握有力。”
- 为什么这有帮助: 现在,当机器人阅读故事并观察图片时,它已经知道了自己的物理状态。它可以利用这个知识来判断图片的哪些部分才是真正重要的。
3. 魔法技巧:“智能聚光灯”
这项创新的最大之处在于它节省了时间。通常,机器人会观察相机图像中的每一个像素,这就像是在高速公路上开车时试图读清广告牌上的每一个字,既费力又缓慢。
ThinkProprio 利用“身体文本”和“指令文本”作为一个智能聚光灯。
- 工作原理: 机器人会问自己:“既然我正拿着一个工具,且指令说‘按下按钮’,那么图像中哪些部分才是真正相关的?”
- 结果: 它忽略了 85% 的图像(背景、地板、天花板),只保留与任务相关的 15% 的图像(按钮和工具)。
- 益处: 这就像是从阅读整个图书馆切换到只读你需要的那一页。这使得机器人快了 58%,并且使用的计算机内存更少,同时没有损失准确性。
4. “投票”系统
机器人如何决定保留哪些部分?它使用了一个聪明的“投票”系统。
- 指令和身体数据会对图像中哪些部分重要进行投票。
- 如果指令说“拿起红色的方块”,而机器人的手靠近桌面,那么“红色方块”就会获得选票。而空荡荡的墙壁则得不到任何选票。
- 机器人保留胜出者,并丢弃其余部分。
5. 结果显示
作者在两个著名的机器人训练场(CALVIN 和 LIBERO)上测试了该系统。
- 性能更好: 机器人更擅长处理长期的复杂任务(如堆叠积木或打开抽屉),因为它能够通过“感受”来推进步骤。
- 速度更快: 因为它不再观察整幅图像,而只观察重要的部分,它可以在 22 毫秒内做出决策(相比之下,其他顶尖模型的决策时间为 52 毫秒)。
- 高效性: 它在实现这些结果的同时,使用的计算机显存(VRAM)也显著减少。
总结
ThinkProprio 就像是给了机器人第六感,让它可以在阅读和观察的同时使用这种感觉,而不是等到最后才去了解。通过将自身的身体位置转化为“文字”,并利用这些文字来过滤视觉中的噪音,机器人变得更快、更聪明,也更高效地执行物理任务。它证明了,为了完成动作,机器人必须从理解任务的第一刻起,就开始思考“如何移动”。
技术摘要:ThinkProprio:面向 VLA 操作的具身视觉推理
问题陈述
视觉-语言-动作(VLA)模型已成为通过将视觉观测和自然语言指令转化为可执行动作来实现通用化机器人控制的强大范式。然而,目前的 VLA 流水线通常在处理栈的后期才引入本体感受信号(如关节角度和末端执行器位姿等机器人状态),或者将其与感知耦合较弱,甚至完全忽略。
这种后期集成机制阻碍了机器人的物理具身性去塑造对任务的初始理解,或影响整个策略过程中哪些视觉标记(tokens)应被关注。因此,模型无法利用物理扎根的状态来确定哪些场景元素对于空间扎根的动作是相关的。虽然像 π0 和 π0.5 这样的近期工作已经开始更早地集成本体感受,但由于视觉-语言聚合和动作头调节(action-head conditioning)之间存在耦合的设计选择,本体感受的功能性作用仍然难以被孤立研究。
方法论:ThinkProprio
作者提出了 ThinkProprio,一种旨在通过将本体感受视为一种积极参与早期视觉推理的一等公民模态来“本体感受式思考”的架构。其核心组件包括:
1. 通过文本标记化的本体感受状态编码
不同于使用学习到的多层感知器(MLP)将连续状态向量投影到 VLM 嵌入空间的方法(这可能会引入分布失配),ThinkProprio 对连续的本体感受状态值进行离散化处理。
- 离散化: 对连续状态值进行裁剪并进行均匀分箱(binning)。
- 标记化: 将这些分箱索引映射到预训练 VLM 嵌入表中的特定词汇标记 ID。
- 集成: 生成的本体感受标记与语言指令标记一起,在 VLM 的输入端进行拼接。这使得机器人的状态能够参与到与语言相同的嵌入空间中,从而实现无需额外投影层的状态感知视觉调节。
2. 物理扎根的标记选择
ThinkProprio 引入了一种机制,根据任务指令和机器人当前的本体感受状态来引导视觉标记的选择。
- 查询生成: 将指令标记 (Hl) 和本体感受标记 (Hp) 拼接形成引导标记 (Hq)。
- 评分: 视觉标记通过关注这些引导标记来形成一个“物理扎根的查询”。通过匹配归一化后的查询与归一化后的视觉标记来计算得分矩阵。
- 选择机制: 系统采用基于投票的离散选择,并使用直通估计器(straight-through estimator, STE)。在评分中加入 Gumbel 噪声以实现可微训练。获得投票的标记被保留,其余则被丢弃。
- 全局上下文: 为了防止丢失粗粒度的场景信息,系统会将一个全局上下文标记(对所有视觉标记取平均值)附加到选定的子集中。
3. 架构与训练
- 骨干网络: 被选中的紧凑序列(包含选定的视觉标记、全局上下文、本体感受标记和语言标记)由预训练的 VLM 骨干网络进行处理。
- 动作头: 动作头通过交叉注意力机制对融合后的 VLM 特征进行调节。
- 目标函数: 动作头使用流匹配(flow matching,一种基于扩散的方法)进行训练,以预测连续的动作块(action chunks)。训练目标是最小化预测速度场与目标速度之间的误差。
核心贡献
- VLA 设计的系统性消融: 本文对 VLA 模型的设计轴进行了首次系统性的比较,解耦了视觉-语言聚合、调节机制以及本体感受编码/切入点。
- 本体感受文本标记化: 作者证明,将本体感受离散化为文本标记并将其输入 VLM 输入端,比使用学习到的投影器或后期调节机制更有效。这充分利用了 VLM 预训练的标记接口。
形式上,这使得状态能够参与到 VLM 的推理过程中。
- 物理扎根的标记选择: 该方法表明,结合指令和本体感受的引导可以有效地将计算偏向于对动作至关重要的证据。这使得模型在仅保留约 15% 视觉标记的情况下,仍能达到或超过使用全量标记模型的性能。
- 高效性: 通过减少传递给 VLM 和动作头的视觉标记数量,该方法显著降低了计算成本。
实验结果
该方法在 CALVIN(ABC→D 分割)和 LIBERO 基准测试以及现实世界操纵任务上进行了评估。
- 任务性能:
- CALVIN: ThinkProprio 实现了平均完成链长度为 4.55,优于强基线模型 FLOWER (4.44) 和 π0.5 (2.38)。它在长程任务(LH-5)中表现出特别显著的提升,成功率达到 82.1%,而 FLOWER 为 77.8%。
- LIBERO: ThinkProprio 实现了 97.3% 的平均成功率,与最佳基线(LightVLA 为 97.4%)相当,并在 LIBERO-Long 系列中取得了最高分(95.2%)。
- 计算效率:
- 延迟: 与 FLOWER 基线相比,ThinkProprio 将端到端推理延迟降低了 58%(在 CALVIN 上从 52 ms 降至 22 ms)。
- 标记缩减: 模型在每个时间步平均仅处理 15 个视觉标记(而非原本可用的 100 个),显著减少了 VLM 和动作头的序列长度。
- 显存(VRAM): 峰值显存占用降低至约 1.9 GB,相比 OpenVLA(约 14.5 GB)有了大幅下降。
意义与主张
本文声称 ThinkProprio 成功解决了当前 VLA 模型中本体感受被视为后期信号的局限性。通过将本体感受标记化并将其与语言指令进行早期融合,模型可以塑造其视觉推理过程,从而优先处理与具身相关的证据。
作者断言:
- 本体感受应当被显式提供,并积极参与到任务理解过程中,而不仅仅是在动作生成阶段。
- 将连续状态进行文本标记化是一种优于学习投影器的编码策略,因为它与预训练的标记嵌入相一致,并允许状态参与 VLM 的推理过程。
- 如果选择过程受到指令和机器人状态的双重引导,那么进行激进的视觉标记缩减是可行的,且不会导致性能下降。
- 该方法在显著降低推理延迟和内存占用 footprint 的同时,在长程任务上表现出强大的性能,为高效的具身机器人控制提供了一条可行路径。
论文总结道,虽然图像提供了许多隐式的状态线索,但通过适当集成本体感受所提供的额外扎根信息,对于复杂的操纵任务(特别是需要长时间修正和接触动力学的长程任务)至关重要。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。