← 最新论文
🤖 AI

X-Tokenizer: A Multimodal Action Tokenizer for Vision-Language-Action Pretraining

X-Tokenizer 是一种轻量级的多模态动作分词器,它通过采用非对称语义残差量化架构和对比预训练,将动作分词重新定义为一个语义接口学习任务,从而在视觉-语言推理与精确连续机器人控制之间架起桥梁,在模拟和现实世界的长程任务中表现显著优于现有方法。

原作者: Xirui Kang, Yanpei Shi, Lucy Liang, Roy Gan, Dongxiu Liu, Pushi Zhang, Danpeng Chen, Xiaoyi Qin, Yinan Zheng, Jinliang Zheng, Hao Wang, Xianyuan Zhan, Hang Su

发布于 2026-06-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Xirui Kang, Yanpei Shi, Lucy Liang, Roy Gan, Dongxiu Liu, Pushi Zhang, Danpeng Chen, Xiaoyi Qin, Yinan Zheng, Jinliang Zheng, Hao Wang, Xianyuan Zhan, Hang Su

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在试图教一个机器人如何泡一杯咖啡。你拥有一个极其聪明的“大脑”(一个视觉-语言模型/Vision-Language Model),它理解世界,知道什么是咖啡杯,也能读懂像“小心地倒咖啡”这样的指令。然而,这个大脑使用的是文字和概念(离散标记/tokens),而机器人的手臂和电机需要的是平滑且连续的运动(比如“向左移动 0.04mm,然后向上移动 0.02mm”)。

问题在于,这两种语言并不匹配。大脑的语言擅长推理,但对于直接控制电机来说又太“粗糙”了。

旧方法:“拉链式压缩” (The "Zipper")

以往的方法试图通过使用一个“分词器”(tokenizer,即翻译器)来解决这个问题,它仅仅是将机器人的动作压缩成一段简短的代码列表,就像拉上行李箱的拉链一样。

  • 它是如何工作的: 它观察动作并判断:“好吧,这个动作看起来像是代码 #42,下一个看起来像代码 #99。”
  • 缺陷所在: 这是一种纯粹的机械式压缩。它保留了动作的形状(因此机器人可以重现它),但它并没有教会机器人的大脑这个动作的含义。大脑只是在通过猜测随机代码来减少误差,而不是真正理解动作背后的意图。这就像是一个只会拉行李箱拉链、却不知道里面装了什么的翻译员。

新方法:X-Tokenizer(“智能翻译官”)

该论文的作者引入了 X-Tokenizer,他们将其描述为不仅仅是一个压缩器,而是一个语义接口(Semantic Interface)。你可以把它想象成一位既精通“机器人电机语言”,又精通“人类概念语言”的翻译官。

以下是它的工作原理,使用了一个创意类比:

1. 双层字典(语义残差量化 / Semantic Residual Quantization)

想象这位翻译官拥有一本特殊的字典,其中有两个截然不同的部分:

  • “大意”部分(顶层): 这部分学习的是意图。如果机器人正伸手去拿杯子,这一部分会学习“抓取杯子”的代码。它被训练用来理解动作的“故事”。
  • “细节”部分(更深层): 这部分处理的是细微差别。它学习在实际抓取杯子而不撞翻它时,所需的那些极其精准的微调。

该论文的创新之处在于对这两个部分进行了差异化处理。其“大意”部分被训练去理解动作的意义,而“细节”部分则仅仅专注于让动作看起来完美无瑕。这创造了一种共享语言,让机器人的大脑在担心物理细节之前,先理解目标。

2. 训练营(预训练 / Pretraining)

在机器人接触真实物体之前,X-Tokenizer 会通过 240 万次记录的机器人动作进行大规模的训练营。它学习了三项特定技能:

  • 掩码动作建模 (MAM): 想象在玩一个关于机器人动作的“填词游戏”(Mad Libs)。翻译官会被展示一段带有缺失部分的动作序列,然后必须根据上下文猜出缺失的那个“词”(动作意图)是什么。这迫使它学习动作的逻辑,而不仅仅是形状。
  • 视觉-语言对齐: 翻译官会看到一段机器人运动的视频以及文字指令“拿起杯子”。它学习将机器人的运动代码直接与指令中的单词相匹配。它学会了“伸手”的代码在语义上与“伸手”这个词是相连的。
  • 未来预测: 它观察当前的动作,并尝试预测下一秒机器人的“视觉”会是什么样子。这教会了翻译官去理解动作的后果,而不仅仅是动作本身。

3. 结果:一种共享语言

一旦训练完成,这些“额外”的训练工具就会被移除,留下一个轻量级的翻译器。当机器人投入使用时:

  • 机器人的大脑(VLM)会预测“大意”代码(例如:“移动到杯子处”)。
  • 因为这些代码经过训练能与大脑的语言相匹配,机器人的内部“想法”会变得与物理任务高度一致。
  • 随后,连续的电机控制器会接收这些想法,并填充“细节”信息,以实现平滑的执行。

为什么这很重要(研究结果)

论文在真实机器人和模拟环境(如双臂机器人玩积木或插花)中测试了该技术。

  • 更好的理解力: 机器人的大脑对任务指令的理解能力显著提升。在测试机器人根据语言指向物体时,准确率提升了 13.5%
  • 更长的任务: 机器人在处理长时、多步骤任务(如“摆放好花,然后打开灯”)方面表现得更好,性能提升了 8.25%
  • 鲁棒性: 即使机器人的动作带有轻微的噪声或抖动,X-Tokenizer 也能保持“大意”代码的稳定,而旧方法则会因此产生混乱并改变整个计划。

核心结论

X-Tokenizer 改变了翻译的角色。它不再仅仅是一个缩减数据的压缩工具,而是一个语义桥梁。它确保了当机器人的“大脑”思考一个动作时,它所思考的内容,其表达方式是其“身体”能够真正理解并执行的。这使得机器人变得更加聪明、更有能力,能够在现实世界中遵循复杂的指令。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →