← 最新论文
🤖 machine learning

Patch Policy: Efficient Embodied Control via Dense Visual Representations

Patch Policy 引入了一种轻量级且高效的基于 Transformer 的架构,该架构通过块因果注意力机制(block-causal attention mechanism)利用来自视觉 Transformer 的密集预训练视觉特征,与现有的全局池化或重型 VLM 方法相比,在实现卓越具身控制性能的同时,显著减少了参数量并降低了计算开销。

原作者: Gaoyue Zhou, Zichen Jeff Cui, Ada Langford, Bowen Tan, Yann LeCun, Lerrel Pinto

发布于 2026-07-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Gaoyue Zhou, Zichen Jeff Cui, Ada Langford, Bowen Tan, Yann LeCun, Lerrel Pinto

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,试图教一个机器人系鞋带或插充电器。为了做到这一点,机器人需要“看见”世界,但不仅仅是像人类瞥一眼房间那样。它需要准确理解鞋带相对于鞋子的位置,或者插头如何与插座对齐。长期以来,机器人的大脑一直有一个奇怪的盲点:它们擅长识别物体是“什么”(比如一个“杯子”),却很不擅长记住物体在空间中确切的“位置”。

为了解决这个问题,科学家们使用了被称为视觉 Transformer (Vision Transformers, ViTs) 的技术。把 ViT 想象成一位超级聪明的侦探,他不仅仅是看一眼犯罪现场的照片并说:“那是一个乱糟糟的房间。”相反,这位侦探会将照片切割成数百个微小的拼图碎片(patches),并仔细研究每一个碎片以理解细微之处。这被称为稠密表示 (dense representation)。相比之下,旧的机器人方法就像是一个眯着眼睛看整张照片、将其模糊成一个点,然后只说:“这是一个乱糟糟的房间”的侦探。这种“点”的方法虽然快,但会丢失完成精细任务所需的微小细节。现在的关键问题是:我们能否在不让机器人的大脑变得过于庞大和缓慢、无法进行实时运动的前提下,赋予它们这种超详细的“拼图式”视觉?

于是,Patch Policy(补丁策略) 应运而生,它给出了答案:“是的,我们可以!”研究人员发现,机器人并不需要拥有巨大的、价值数十亿美元的超级计算机才能实现高清视觉。他们构建了一个轻量级的机器人大脑,可以直接“吞食”这些微小的拼图碎片,跳过了庞大 AI 模型中沉重的计算环节。

这就是他们是如何做到的,以及他们发现了什么。

问题所在:“模糊的点” vs. “沉重的巨人”

多年来,机器人控制器一直面临两个糟糕的选择:

  1. 模糊的点: 它们会将摄像机图像压缩成一个单一的、微小的总结(一个“全局标记”)。这很快,但就像戴着雾面眼镜穿针引线一样。你知道那里有一根针,但你看不清针眼。
  2. 沉重的巨人: 为了获得更好的视觉效果,一些团队开始使用庞大的“视觉-语言-动作”(VLA)模型。这些模型就像一位精通字典里每一个单词、能看到每一个像素的天才教授。但这些教授太“重”了(拥有数十亿个参数),导致他们行动迟缓。他们思考的时间太长,导致机器人很难对掉落的杯子做出快速反应。

团队提出了疑问:我们能否既拥有巨人的超强视觉,又没有它的重量?

解决方案:Patch Policy(补丁策略)

答案就是 Patch Policy。想象你在玩电子游戏。通常,游戏可能会告诉你:“你在森林里。”那是“全局”视角。Patch Policy 则会告诉你:“你在森林里,具体来说,你的左侧 2 英寸处有一个松果,右侧 4 英寸处有一块石头,上方 10 英寸处有一只松鼠。”它直接将所有这些具体的细节(即“补丁”)喂给机器人的大脑。

但这里有一个难点。如果你一次性向机器人大脑输入过多的细节,它会搞不清事情发生的时间。松鼠是在石头落下之前还是之后跳出来的?为了解决这个问题,研究人员发明了一种特殊的“红绿灯”系统,称为块因果注意力掩码 (block-causal attention mask)

  • 工作原理: 在单个摄像机帧(一张快照)内部,机器人被允许同时观察所有的拼图碎片,以理解场景。但是,它被严格禁止利用“未来”的拼图碎片来对“现在”做出决策。它保持了时间线的整齐,正如真实的机器人所需要的那样。

这使得机器人能够使用预训练的“现成”视觉模型(如 WebSSL 或 DINOv2),这些模型已经完美掌握了如何观察世界,而无需从头开始重新教机器人如何看世界。

他们的发现:小巧且快速的胜利

团队在四种不同的视频游戏模拟环境和三个真实世界的机器人任务(如插电缆、挂工具和收集笔)中测试了这个新的机器人大脑。结果如下:

  • 优于“模糊的点”: 在模拟实验中,使用 Patch Policy 的机器人在任务中的表现比使用旧有的“全局点”方法的机器人高出 40%。当任务需要精确度时——比如堆叠积木或将物体推到特定位置——详细的视觉带来了巨大的差异。
  • 击败“沉重的巨人”: 或许最令人惊讶的是,Patch Policy 在成功率上击败了一个名为 OpenVLA-OFT 的大规模微调 VLA 模型,领先了 18%。但关键在于:Patch Policy 使用的参数量(即“大脑大小”)仅为那个巨型模型的约 0.7%
  • 现实世界的精准度: 在真实机器人上,差异非常明显。对于一项名为“电缆插入”的任务(插头必须进入一个只有 2 毫米 误差空间的插座),旧方法经常卡住。Patch Policy 的成功率达到了 70%,而那个巨型模型 OpenVLA-OFT 的成功率仅为 30%。巨型模型似乎理解“插电缆”这个概念,但在处理实际操作所需的微小、精细的动作时失败了。
  • 速度: 这种新方法速度极快。它可以在大约 11 毫秒(0.011 秒)内做出决策。这足以让机器人进行实时反应,而沉重的巨型模型则需要更长的时间。

“不要挤压”原则

研究人员还测试了一个常见的想法:“我们能不能把拼图碎片挤压在一起,让它变得更快?”他们尝试将补丁数量从 256 个减少到仅 1 个(变回“模糊的点”)。结果呢?机器人的工作表现变得很糟糕。成功率显著下降。这证明了对于精密的机器人手部动作,你确实需要保留所有那些微小的细节;你不能简单地通过总结来忽略它们。

核心结论

论文表明,我们不需要通过制造更大、更重的机器人来让它们变得更聪明。相反,我们只需要让它们以高清模式观察世界。通过使用一种巧妙的技巧,将详细的“补丁”图像直接输入到轻量级的大脑中,Patch Policy 让机器人能够比以前更快、更准确地学习复杂的精细任务。这提醒我们,有时,前进的最佳方式并不是建造一个更大的引擎,而是更仔细地观察路面。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →