← 最新论文
💬 NLP

M2{M}^2Tok: Multi-head Multi-codebook Discrete Action Tokenization for Vision-Language-Action Models

本文提出了 M2\mathcal{M}^2Tok,一种新型的多头多码本动作分词器,它通过将潜在特征分解为具有独立码本的专门化头部,以更好地捕捉细粒度的动作动态,从而显著降低了重构误差并提升了视觉-语言-动作模型的性能。

原作者: Chunpu Xu, Zhixuan Liang, Yuhao Zhang, Chi-Min Chan, Jessie Wang, Yang Xiao, Mengkang Hu, Xiaokang Yang, Yao Mu

发布于 2026-09-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Chunpu Xu, Zhixuan Liang, Yuhao Zhang, Chi-Min Chan, Jessie Wang, Yang Xiao, Mengkang Hu, Xiaokang Yang, Yao Mu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

长期以来,机器人一直难以像人类手部那样拥有流动的优雅感。虽然现代人工智能现在已经可以撰写诗歌、诊断疾病并生成令人惊叹的图像,但赋予机器物理操控世界的能力仍然是一个棘手的挑战。问题的核心在于计算机如何理解运动。与由离散字母组成的文本或由像素组成的图像不同,机器人手臂的物理动作是连续的数据流。机器人手臂并不仅仅是从一个位置跳到另一个位置,它是在无数个微小的中间位置之间流动的。为了使用驱动当今人工智能的强大语言模型来教导机器人,工程师必须首先将这种平滑的连续运动转化为一系列离散的步骤,就像将一条流动的河流变成一串独立的珠子一样。这种转换过程被称为分词(tokenization)。如果转换过于粗糙,机器人就会失去运动的精细细节,导致动作生硬、不精确,从而无法完成精细任务。如果转换过于复杂,计算机就无法处理得足够快以进行实时反应。

多年来,研究人员一直试图解决这个转换问题,但现有的方法往往是“削足适履”。一些方法将每种运动视为简单的固定类别列表,这忽略了步骤之间微妙的时机和关系。另一些方法尝试通过将运动分组来压缩数据,但它们往往会丢失精确控制所需的特定细节,例如手腕的确切角度或抓取器的轻微挤压。这种细节的丢失造成了瓶颈,阻碍了机器人学习复杂的技能,如堆叠易碎物体或组装复杂的零件。其结果是,机器人可以执行广泛的简单任务,但在面对现实世界的微妙需求时却会踉跄跌倒。

现在,一组研究人员提出了一种处理这种转换的新方法,提供了一种既能保留运动丰富性,又能保持数据紧凑性以供现代人工智能处理的方法。他们将该系统称为 M2Tok,这是一个旨在将机器人动作的连续流分解为语言模型可以理解的格式,且不会丢失成功所需的细粒度动态特征的工具。该方法并没有将机器人的整个身体视为一个单一的、整体的数据块,而是将运动拆分为多个独立的、专门的通道。想象一下,一个机器人手臂需要同时移动它的肩膀、肘部、手腕和抓取器。旧的方法会尝试将所有这些不同的运动压缩成一个单一的代码,通常迫使系统在手臂的准确性和抓取器的准确性之间做出选择。然而,新方法将这些运动分离成不同的组,允许人工智能独立地关注每个部分的特定细微差别。

研究人员通过将机器人的运动数据划分为多个“头”(heads)来实现这一点,其中每个“头”负责运动的一个不同方面。一个“头”可能追踪手臂的位置,而另一个“头”则追踪抓取器的开合。至关重要的是,每个“头”都使用自己独立的运动代码字典。通过使用并行工作的多个字典,该系统创造了大量的可能组合,远比单个字典所能提供的要多。这种组合力量使得系统能够以高精度表示更广泛多样的运动。这类似于音乐家可以通过在不同乐器上结合有限的音符来创造无限的旋律;新系统通过在机器人身体的不同“乐器”上结合有限的运动代码集,以极高的忠实度重现复杂的动作。

为了测试这个想法,研究人员在大量的模拟机器人任务上训练了他们的系统,范围从敲击木块到拿起各种瓶子以及将容器放在盘子上。他们将这种新方法与该领域使用的几种现有技术进行了比较。结果显示出新方法的明显优势。在十二个不同的模拟任务中,使用新方法的机器人成功率达到了 51%,显著高于排名第二的方法(其成功率为 45%)。在需要高精度的困难任务中,这种改进更为显著。例如,在一个涉及将罐子移动到锅中的任务中,新方法的成功率几乎是之前最佳方法的两倍。在另一个涉及将汉堡和薯条盒放在托盘上的任务中,新方法的成功率为 64%,而之前的最佳方法仅为 52%。

研究人员还在另一组模拟环境中测试了该系统,以观察技能是否可以迁移到新情况。在这里,新方法再次展示了卓越的性能,实现了 28% 的成功率,而领先的替代方案为 21%。最显著的区别出现在一个需要机器人拿起茄子并将其放入篮子中的任务中。茄子是一种形状不规则、难以抓取的物体,以往的方法完全无法解决这个任务。然而,新方法成功了 33% 的时间,这表明其捕捉精细细节的能力使其能够处理其他方法无法处理的复杂几何形状物体。

为了确保这些结果不仅仅是模拟的结果,团队将训练好的模型应用于真实世界的机器人。他们使用了一个配备了四个机械臂和一个摄像头的移动平台,要求机器人执行三个不同的任务:摇铃、将容器放在盘子上以及拿起不同的瓶子。这些是零样本测试(zero-shot tests),这意味着机器人从未见过这些特定的现实世界物体或环境;它们必须完全依赖于在模拟中学到的知识。新方法再次胜过其他方法,在三个任务中的平均成功率为 33%,而表现最好的替代方案最高为 28%。这些测试的视觉证据显示,机器人成功识别了物体的位置并执行了精确的抓取操作,证实了高质量的运动数据转换在机器人离开计算机进入物理世界后依然有效。

除了准确性之外,研究人员还观察了系统的运行速度。对于机器人要发挥作用,它必须能够足够快地做出决策以应对环境。新方法允许机器人以超过 8 赫兹(hertz)的频率运行,这意味着它每秒可以做出八次以上的决策。这相对于仅为 2 赫兹的旧方法是一个显著的进步。此外,当研究人员使用专门的处理引擎优化系统速度时,机器人可以达到 56 赫兹的频率,远超大多数实时操作任务所需的频率。这种高精度与高速度的结合表明,该新方法可以成为在动态环境中部署先进机器人的实际解决方案。

这项工作的成功取决于处理运动数据方式的基本转变。通过拒绝“所有运动都必须压缩成单一、统一代码”的想法,研究人员让系统能够尊重机器人身体不同部分的独特性质。将运动分离为独立通道的方法,结合使用多个专门字典的技术,创造了一个能够捕捉到以往方法所遗漏的微妙、高频运动细节的系统。这种方法不需要改变驱动机器人的底层语言模型的架构;相反,它提供了一种向这些模型输入数据的更好方式。其结果是,机器人能够以一种以前无法企及的灵巧程度来理解并执行复杂的物理任务,弥合了驱动语言模型的数字智能与它们旨在导航的物理现实之间的鸿沟。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →