← 最新论文
💻 computer science

Inference-time Policy Steering via Vision and Touch

ViTaL 是一种新颖的视觉-触觉推理时转向框架,它通过将高层视觉模式选择与低层触觉引导的动作精细化相结合,增强了预训练机器人策略在富接触操作任务中的表现,并实现了相对于单模态及朴素融合基准模型的显著成功率提升。

原作者: Yilin Wu, Zilin Si, Zeynep Temel, Oliver Kroemer, Andrea Bajcsy

发布于 2026-06-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Yilin Wu, Zilin Si, Zeynep Temel, Oliver Kroemer, Andrea Bajcsy

原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人执行精细的任务,比如将液体从移液管中倒入特定的杯子,或者擦拭桌面而不留下水迹。你手中的机器人已经具备了相当不错的移动能力(它的“基础策略”),但它有时会犯错,因为它无法“感知”到自己正在做什么,或者观察得不够长远。

这篇论文介绍了一个名为 ViTaL(视觉-触觉潜空间转向,Visuo-Tactile Latent Steering)的新系统来修复这些错误,且无需从头开始重新训练机器人。你可以把 ViTaL 想象成一个智能副驾驶,它坐在机器人旁边,观察机器人的每一个动作,并在机器人实际执行动作之前,低声进行纠正。

以下是 ViTaL 的工作原理,通过简单的概念进行拆解:

1. 问题所在:眼睛 vs. 双手

作者发现,仅依靠一种感官不足以应对复杂的任务:

  • 视觉(眼睛)擅长“大局观”: 它可以告诉机器人,“你正在向蓝色杯子移动,而不是红色杯子。” 但眼睛无法告诉机器人它是否捏得太用力,或者抓握是否在打滑。
  • 触觉(双手)擅长“细节”: 它可以感知机器人是否施加了正确的压力。但仅靠触觉并不知道机器人正瞄准哪个杯子;它只知道“我正握着某个东西”。

如果只用眼睛,机器人可能会瞄准正确的杯子,但却捏碎了移液管。如果只用触觉,机器人可能会完美地握住移液管,但却把液体倒进了错误的杯子里。

2. 解决方案:两步走的“副驾驶”系统

ViTaL 通过将工作分为两个层级来解决这个问题,就像一个将军和一个专家

  • 第一层:将军(视觉)
    系统首先观察遥远的未来(就像看向漫长的公路)。它会问:“如果机器人这样做,它最终会到达正确的目标吗?” 它根据所见内容选择最佳的整体方案。这被称为视觉模式选择(Visual Mode Selection)

    • 类比: 想象一个 GPS 告诉你,“走高速公路去城市。” 它现在并不关心路上的坑洼,它只关心目的地。
  • 第二层:专家(触觉)
    一旦“将军”选定了高速公路,“专家”就会聚焦于紧接着的几步。它会问:“机器人的方向盘握得太紧了吗?它是不是快撞到减速带了?” 它会微调机器人的动作,以确保接触的感觉是正确的。这被称为触觉精炼(Tactile Refinement)

    • 类比: 现在想象一位驾驶教练坐在你旁边,对你说,“放轻油门,你在过这个弯道时速度太快了。” 他们不会改变你的目的地,他们只是优化你的驾驶方式,让你安全到达。

3. 核心秘诀:“想象引擎”

为了在不真正撞坏机器人的情况下实现这一点,ViTaL 使用了一个潜空间世界模型(Latent World Model)。你可以把它看作是机器人的想象力

  • 在机器人移动之前,它会先“想象”接下来会发生什么。
  • 它会创造一部关于未来的“心理电影”,既包括摄像头会看到的景象(杯子),也包括传感器会感受到的感觉(压力)。
  • 然后,它会将这部“心理电影”与指令进行对比。如果电影显示机器人会洒出液体,它就会拒绝该计划并尝试另一个方案。

4. “文本到感觉”的翻译器

ViTaL 的一个独特之处在于它提供指令的新方式。你不需要编写复杂的数学代码来告诉机器人“施加 5 牛顿的力”,该系统可以理解普通英语

  • 你可以告诉机器人:“轻握”或“重握”。
  • 系统会将这些词语直接转化为机器人的“感觉”语言。它会检查机器人“想象中”的抓握感是否符合“轻”或“重”的感觉。这是作者声称首次实现将自然语言用于机器人触觉控制。

5. 结果:它奏效了吗?

团队在三个现实世界的任务中测试了 ViTaL:

  1. 移液: 在杯子之间转移液体。
  2. 擦拭: 清洁表面。
  3. 插入: 将销钉放入孔中。

研究结果显示:

  • 更高的成功率: 与机器人的原始“基础”策略相比,ViTaL 将成功率提高了 51%
  • 优于单一感官: 它比仅使用视觉或仅使用触觉的系统至少高出 33%
  • 优于简单的融合: 它比那种仅仅试图同时结合视觉和触觉的“天真型”系统至少高出 20%

总结

简而言之,ViTaL 是一个智能系统,它让机器人能够瞻前顾后以选择正确的目标,并感知当下以温柔地执行任务。它就像一个完美的团队:一个伙伴规划路线,另一个伙伴平稳驾驶,确保机器人不仅在看起来是在做正确的事,而且在感觉上也是在正确地执行任务。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →