← 最新论文
💬 NLP

Beyond English: Uncovering the Multilingual Gap in Vision-Language-Action Models

本文提出了首个系统性研究,揭示了尽管视觉-语言-动作模型拥有多语言语言骨干网络,但在处理非英语指令时仍存在显著的性能差距,并提出了一种多语言主成分对齐微调策略,以有效缓解这一问题。

原作者: Hanyang Chen, Hongliang Li, Jiarui Cao, Yang Li, Yang Jiang, Haonan Wen, Kaiyu Huang, Shengnan Guo, Huaiyu Wan

发布于 2026-06-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Hanyang Chen, Hongliang Li, Jiarui Cao, Yang Li, Yang Jiang, Haonan Wen, Kaiyu Huang, Shengnan Guo, Huaiyu Wan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心思想:“仅限英语”的机器人

想象一下,你正在教一个机器人做饭。你有一个非常聪明的机器人大脑(一个视觉-语言-动作模型,简称 VLA),它能看到厨房,理解你的话,并移动它的手臂去抓取勺子或打开炉灶。

研究人员发现了一个重大问题:大多数这类机器人就像是在英语环境下学习的学生。 即使机器人的“大脑”(底层的语言模型)懂得如何说法语、中文或阿拉伯语,机器人本身却不知道如何根据这些语言来进行“动作”。

当你用英语下达指令(“Pick up the cup”)时,它表现得完美无缺。但如果你用完全相同的意思用法语表达(“Prends la tasse”),机器人往往会僵住、感到困惑,或者抓错了物体。就好像机器人仅仅因为你更换了语言,就突然忘记了如何移动双手一样。

实验过程:测试机器人的“耳朵”

研究人员想要验证这是否属实。他们采用了现有的机器人训练数据(几乎全是英文),并创建了一个“多语言测试”。

  1. 翻译: 他们将英文指令翻译成了四种其他语言:中文、法语、俄语和阿拉伯语。
  2. 混合模式: 他们还创建了“语码转换”(code-switching)指令,即句子大部分使用一种语言,但包含几个关键的英文单词(如“cup”或“pick”)。
  3. 测试: 他们要求机器人在模拟厨房中使用这些不同的语言执行任务。

他们的发现:“多语言差距”

结果非常明确:存在巨大的差距。

  • “仅限英语”的大脑: 在英文数据上训练的机器人在被要求使用其他语言时表现极差。它们的成功率显著下降,有时几乎降至零。
  • “多语言”的大脑: 一些建立在已具备多种语言能力的语言模型(如 Qwen-VL)之上的机器人表现较好,尤其是在处理中文时,但与英文相比仍有差距。
  • 视觉陷阱: 当视觉场景令人困惑时,问题会变得更加严重。如果两个不同的任务看起来完全一样(例如把碗放在盘子上 vs. 打开炉灶),机器人会高度依赖语言。如果语言是外语,机器人就会彻底迷失。
  • 关键词的力量: 有趣的是,如果机器人听到的是法语句子,但其中的单词“cup”仍然是英文,它的表现就会好得多。这就像机器人拥有一个“关键词触发器”,即使它不理解整个句子,也能通过这个词来弄清楚该做什么。

为什么会发生这种情况?(“翻译”问题)

研究人员深入观察了机器人的“大脑”内部,以寻找问题所在。他们发现了两个主要问题:

  1. 理解混乱: 有时,机器人根本无法理解外语指令。它听到法语中的“turn on the stove”,却以为你说的是“put the bowl on the plate”,因为视觉场景看起来很相似。
  2. “动作头”(Action Head)不匹配: 这是一个技术性部分,但你可以把它想象成流水线末端的翻译员。机器人的大脑理解了单词,但实际驱动手臂的部分(“动作头”)是针对英文进行微调的。当语言改变时,发送给手臂的“信号”就会变得混乱。
    • 类比: 想象一位指挥家(大脑)正对着管弦乐队用法语指挥,但乐手们(机器人手臂)只懂得阅读为英文使用者编写的乐谱。于是,音乐被演奏错了。
    • 他们发现,某些类型的“指挥家”(被称为 GR00Tπ 的特定设计)比其他类型更能处理这种混淆。

解决方案:“主成分对齐”(MPCA)

研究人员不仅指出了问题,还提出了解决方法。他们提出了一种名为**多语言主成分对齐(Multilingual Principal Component Alignment, MPCA)**的方法。

  • 类比: 想象机器人的大脑拥有一张关于“单词如何关联动作”的“地图”。在英语中,这张地图很清晰;而在法语中,地图向左偏移了,导致机器人走错了方向。
  • 修复方法: MPCA 就像一个指南针,它可以重新对齐法语地图,使其指向与英语地图相同的方向。它不需要从头开始重新训练整个机器人,只需提取现有的知识,并将外语数据进行“旋转”,使其适配机器人现有的动作系统。

总结

论文得出结论:我们不能仅仅因为语言模型是多语言的,就假设机器人能在全球范围内工作。如果我们希望机器人在现实的多语言环境中工作,我们需要专门训练并使它们对齐,使它们理解不同的语言应当导向相同的物理动作。

他们展示了通过一个简单的调整(MPCA),我们可以显著提高机器人遵循非英语指令的能力,使其为现实世界做好准备。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →