← 最新论文
💻 computer science

UniFS: Unified Fast-to-Slow Hierarchical Architecture for Vision-Language-Action Models

UniFS 引入了一种用于视觉-语言-动作(Vision-Language-Action)模型的统一快-慢分层架构,该架构通过按更新频率对 VLM 层进行分层,并重新路由多尺度特征交互以解决效率与准确性之间的权衡,在 LIBERO 基准测试和真实机器人平台上实现了最先进的性能并显著降低了延迟。

原作者: Lin Sun, Zhiwei Guan, Conglin Wang, Zihong Chen, Jianhai Yu, Zongsheng Li, Boyong He, Tao Sun, Jiale Cao, Lige Liu

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Lin Sun, Zhiwei Guan, Conglin Wang, Zihong Chen, Jianhai Yu, Zongsheng Li, Boyong He, Tao Sun, Jiale Cao, Lige Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试教一个机器人完成一项精细的任务,比如堆叠积木或拿起杯子。为了做到这一点,机器人需要两样东西协同工作:

  1. 大脑(视觉语言模型): 这部分负责观察场景、阅读指令并理解“大局”(例如:“我需要把红色的积木叠在蓝色上面”)。它很聪明,但思考速度较慢。
  2. 双手(动作专家): 这部分负责实际移动机器人的手臂。它需要做出即时反应,以防止机器人掉落物品,因此必须非常快速。

问题:“速度与智慧”的困境

目前的机器人大脑面临着一个令人沮丧的悖论。

  • 旧方法: “大脑”和“双手”是分离的。大脑向双手发送缓慢的更新。如果大脑更新得太频繁,机器人就会变得迟钝;如果大脑更新得太稀疏,大脑的指令在双手接收到时就已经过时了(就像试图去接一个已经移动位置的球)。
  • 信息丢失: 更糟糕的是,双手只能接收到大脑的“最终想法”。它们错过了大脑在思考过程中产生的所有有趣的“思考步骤”,这限制了机器人运动的精准度。

解决方案:UniFS(“多速大脑”)

这篇论文的作者提出了 UniFS,他们借鉴了人类大脑的工作方式。他们注意到,人类的大脑并不只有一个速度,而是同时以不同的速度处理信息。快波处理即时的感官细节(如突然的噪音),而慢波则处理深层且稳定的思维(如你的名字或长期计划)。

UniFS 通过创建一个**统一的从快到慢的架构(Unified Fast-to-Slow Architecture)**将这一理念应用于机器人。以下是它的工作原理,使用简单的类比进行说明:

1. “分层团队”(分层结构)

与其让整个大脑以同一种速度思考,UniFS 将大脑的层级划分为一个具有不同轮换计划的团队:

  • 浅层(侦察兵): 这些是网络的外部层。它们更新得非常快(每一步都会更新)。它们就像四处奔跑的侦察兵,不断报告环境中的即时变化(例如:“杯子刚才晃动了一下!”)。
  • 深层(战略家): 这些是内部层。它们更新得非常慢(每隔几步才更新一次)。它们就像指挥中心里的将军,紧握着稳定的计划(“叠好红色积木”),以免被微小的晃动分散注意力。

结果: 机器人同时获得了两者的优势:对变化的即时反应能力以及稳定的长期计划。

2. “秘密交接”(潜在向量反转)

这里有一个棘手的问题:在标准的 AI 中,由于深层(慢速战略家)过于靠近动作输出,它们实际上变化得太快了。这破坏了计划中“慢速”的部分。

为了解决这个问题,UniFS 使用了一个巧妙的技巧,称为潜在向量反转(Latent Vector Inversion)。

  • 类比: 想象一场接力赛,接力棒是以相反的顺序传递的。通常情况下,“快”的跑者(浅层)会将接力棒传给“慢”的跑者(深层)。UniFS 则反转了这一点:将“快”的感官细节发送给处理精细动作控制的层,而将“慢”的稳定计划发送给处理宏观蓝图的层。
  • 为什么有效: 这确保了“战略家”保持冷静和稳定,而“侦察兵”处理混乱、快速移动的细节。它将正确的信息与正确的工作匹配在一起。

3. “教练的哨声”(多级监督)

为了确保机器人学习正确,训练过程使用了多级监督(Multi-Level Supervision)。

  • 类比: 教师不再仅仅根据期末考试(最终动作)来给学生(机器人)评分,而是在学习过程的每一个阶段都给予反馈。
  • 目标: 这迫使“慢速”层学习如何制定长期计划,并迫使“快速”层学习如何进行快速修正,从而防止机器人采取捷径或产生困惑。

结果:更快、更聪明

论文在 LIBIO(一组机器人操控任务)以及在真实的 Franka 机械臂上测试了这个新系统。

  • 速度: 新系统比以往的方法快 2.1 倍。它将决策时间从 36.5 毫秒缩短到了仅 17.8 毫秒。这就像是从行动迟缓的蜗牛变成了敏捷的短跑选手。
  • 成功率: 它实现了 98.3% 的成功率,这是目前最高的(最先进水平),优于其他模型。
  • 记忆力: 由于“慢速”层不会每一步都更新,它们能够自然地保留过去的上下文,而无需额外的记忆库。这就像拥有一个内置的短期记忆,可以自动记住几秒钟前发生的事情。

总结

UniFS 就像是给了机器人一个可以同时以多种速度思考的大脑。它有一个用于即时安全保障的快速反应外层,以及一个用于长期规划的稳定内层。通过反转这些层级与机器人双手沟通的方式,并结合每个层级的特定反馈进行训练,机器人变得比以往任何时候都更快、更准确。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →