← 最新论文
🤖 AI

Mixture of Horizons in Action Chunking

本文提出了混合时界(Mixture of Horizons, MoH),这是一种即插即用的策略,通过将动作块重新排列为具有不同时界的段落,以同时优化长期预见性和短期精确性,从而克服视觉-语言-动作(Vision-Language-Action)模型中固有的权衡问题,并实现具备动态推理能力的先进性能。

原作者: Dong Jing, Gang Wang, Jiaqi Liu, Weiliang Tang, Zelong Sun, Yunchao Yao, Zhenyu Wei, Yunhui Liu, Zhiwu Lu, Mingyu Ding

发布于 2026-06-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Dong Jing, Gang Wang, Jiaqi Liu, Weiliang Tang, Zelong Sun, Yunchao Yao, Zhenyu Wei, Yunhui Liu, Zhiwu Lu, Mingyu Ding

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是关于论文《Mixture of Horizons in Action Chunking》的解释,使用了简单的语言和日常类比。

核心问题:“变焦镜头”的两难困境

想象你正在开车。为了安全驾驶,你需要同时具备两样东西:

  1. 长期预见性: 你需要看向远方的路面,看到前方即将出现的弯道,以便及早开始转向。
  2. 短期精准度: 你需要近距离观察仪表盘以及车头正前方的路面,以避免撞到坑洼或小松鼠。

论文指出,目前的机器人大脑(被称为视觉-语言-动作模型,即 VLA 模型)很难同时做到这两点。它们被迫选择一个“缩放级别”(作者称之为时界/Horizon):

  • 如果放大缩小倍数(长时界/Long Horizon): 它们擅长规划复杂的、多步骤的任务(比如“去厨房,打开冰箱,拿牛奶”)。但是,它们在处理细微、即时的动作时会变得笨拙。它们可能会因为观察不够细致而撞到物体。
  • 如果放大缩小倍数(短时界/Short Horizon): 它们在处理即时动作时非常精准。但是,它们会对大局感到困惑。它们可能会拿到了牛奶,却忘了先打开冰箱,或者在漫长的步骤序列中迷失方向。

以前,工程师必须为整个机器人选择一个缩放级别。如果选错了,机器人就会在某些任务上失败。

解决方案:“时界混合”(Mixture of Horizons, MoH)

作者提出了一种聪明的解决方法,叫做时界混合(Mixture of Horizons, MoH)。与其强迫机器人只选择一个缩放级别,不如让机器人能够同时使用多个缩放级别

把它想象成一个由三位专家组成的团队站在机器人旁边,他们看着同一个场景,但使用的是不同的镜头:

  • 专家 A 观察未来 10 步(短期)。
  • 专家 B 观察未来 20 步(中期)。
  • 专家 C 观察未来 30 步(长期)。

机器人的大脑(“动作 Transformer”)会同时向这三位专家征求建议。然后,一个微小且聪明的“门卫”(一个简单的线性层)会倾听所有人的意见并做出决定:“对于当前的这个瞬间,专家 A 关于转动方向盘的建议最好,但专家 C 关于接下来该往哪开的建议更好。”

机器人随后将这些意见结合起来,形成一个完美的动作。

实际运作方式

  1. 并行处理: 机器人不需要运行三个不同的脑子。它运行一个大脑,同时处理所有三个“缩放级别”。这非常快,不会拖慢机器人的速度。
  2. 门卫(Gatekeeper): 这是一个微型、轻量级的组件(仅增加 2,000 个参数),它学习如何混合这些建议。它会学习到:对于“长而弯曲的路径”,它应该更多地信任长期专家;对于“狭窄的挤压空间”,它应该更多地信任短期专家。
  3. 动态推理(“自我修正”功能):
    • 论文引入了一个很酷的技巧,即机器人会检查所有的专家是否达成了一致。
    • 如果专家们对接下来的 10 步都意见一致,机器人就会自信地一次性执行完这 10 步(动作很快)。
    • 如果专家们开始产生分歧(比如机器人正接近一个棘手的决策点),机器人会提前停止,重新评估并重新规划。
    • 类比: 想象你在森林中行走。如果路径笔直清晰,你就迈大步走;如果你遇到了岔路口或灌木丛,你就停下来,观察四周,然后迈出更小、更谨慎的步伐。机器人会自动完成这个过程,使其既更快又更安全。

结果:为什么这很重要

作者在机器人执行折叠毛巾、倒牛奶和堆叠积木等任务时测试了该方法。

  • 全方位提升: 机器人变得在处理短期精准任务(如倒牛奶而不洒出来)和长期复杂任务(如把笔放入抽屉并关上抽屉)方面都表现得更好。
  • 消除了权衡: 它解决了“变焦镜头”的两难困境。机器人不再需要在精准度和规划能力之间做取舍。
  • 速度: 由于机器人在有信心时可以采取更长的步幅,它完成任务的速度比以往的方法快了 2.5 倍,且没有增加错误。
  • 即插即用: 这种方法可以添加到几乎任何现有的机器人大脑中,而无需重建整个系统。

总结

这篇论文引入了一种赋予机器人“多镜头”视觉的方法。与其强迫它们在观察大局或观察细节之间做出选择,不如让机器人同时使用两者。一个智能的“混合器”将这些视角结合起来,从而做出既具前瞻性又具精准性的决策,使机器人在现实世界中移动得更快、更聪明。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →