← 最新论文
💬 NLP

Limited Linguistic Diversity in Embodied AI Datasets

本文对广泛使用的视觉 - 语言 - 动作(VLA)数据集进行了系统性审计,揭示出这些数据集主要依赖重复性、模板化的指令,语言多样性有限,从而凸显了需要更规范的数据集构建与报告以拓宽语言覆盖范围。

原作者: Selma Wanna, Agnes Luhtaru, Jonathan Salfity, Ryan Barron, Juston Moore, Cynthia Matuszek, Mitch Pryor

发布于 2026-04-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Selma Wanna, Agnes Luhtaru, Jonathan Salfity, Ryan Barron, Juston Moore, Cynthia Matuszek, Mitch Pryor

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人如何做家务。你拥有一个庞大的视频记录库,展示了人类执行这些任务的画面,而每个视频都配有该人类在执行任务时所说的语音录音。这个库就是“数据集”。

这篇论文就像是对该库进行的一次语言审计。作者们审视了用于训练现代“视觉 - 语言 - 动作”(VLA)机器人——即那些能看见世界、理解语言并移动手臂的系统——的最流行库,并提出了一个简单的问题:“这些‘书’中的语言有多大的多样性?”

以下是他们的发现,通过简单的类比进行解释:

1. “坏唱片”问题

作者发现,这些机器人训练库极其重复。这就像你试图学习一门语言,但你的教科书只有一句话:“拿起红色的杯子。”然后,在接下来的 10,000 页里,这本书只是反复说:“拿起红色的杯子”、“拿起红色的杯子”和“拿起红色的杯子”,偶尔可能把杯子换成“蓝色的杯子”。

  • 发现:在 RT-1 等主要数据集中,少于 2% 的指令是独特的。其余的只是复制品或对相同几个指令的轻微变体。
  • 比喻:这就像一个 DJ 的播放列表里只有一首歌。他们可以加速或减速,但永远不会播放不同的曲目。机器人学会的是识别指令的声音,而不是其含义

2. “微小词汇”盒

由于指令如此重复,机器人是在非常有限的词汇量下学习的。

  • 发现:某些数据集仅使用49 个独特的单词来描述数千种动作。
  • 比喻:想象一下,试图只用“走”、“停”、“红”和“球”这几个词来描述一部复杂电影的剧情。你可以传达基本想法,但无法解释细微差别、例外情况或复杂场景。机器人被困在一个“词汇监狱”中,只知道 handful 的动词和名词。

3. 逻辑的“平面国”

论文考察了句子的结构。真正的人类语言充满了转折、变化和逻辑。我们会说:“如果灯是红的,就不要过马路”,或者“别碰那个热锅”,或者“拿起苹果,然后把它放进袋子里”。

  • 发现:机器人数据集几乎完全是“扁平”的。它们缺失了:
    • 否定:像“不”或“别”这样的词出现在不到 2% 的指令中。
    • 条件句:像“如果”或“除非”这样的词几乎不存在。
    • 复杂性:指令通常是简单的、单步的命令。
  • 比喻:机器人被教导去导航一个完全笔直且可预测的世界。它们尚未学会如何处理“如果……会怎样”的情景,或者如何阻止自己去做危险的事情。如果你告诉一个基于这些数据训练的机器人“别把杯子弄掉”,它可能无法理解“别”是什么意思,因为它从未听过这个词。

4. “模板”工厂

作者发现,许多数据集是使用“模板”创建的。

  • 比喻:想象一个填词游戏(Mad-libs),你只需填空。数据集创建者写了一个模板,如:[动作] [物体] 在 [位置] 附近。他们只是把“苹果”换成“橙子”,把“桌子”换成“柜台”。
  • 结果:这产生了一种“机器人式”的说话方式,听起来不像人类之间的真实对话。它缺乏真实对话中自然的流畅度、俚语或多样的句子结构。

5. 比较:机器人与人类

为了证明他们的观点,作者将这些机器人数据集与用于训练通用聊天机器人(就像你在手机上与之对话的那些)的数据集进行了比较。

  • 发现:聊天机器人数据集就像一个拥有数百万种不同声音、口音和句子结构的繁忙城市。而机器人数据集则像一条安静、空旷的走廊,每个人都在低声重复相同的三个短语。
  • 结论:尽管机器人数据集在规模上巨大(数百万个视频),但在语言多样性上却非常微小。

论文的建议(“修复”方案)

作者并不是说机器人坏了;他们是说操作手册太简单了。他们建议,为了让机器人更聪明、更灵活,我们需要:

  1. 增强数据:利用人工智能将简单的命令改写为更复杂、更多变的句子(例如,将“拿起杯子”改为“如果杯子没满,就抓住那个杯子”)。
  2. 收集更好的数据:在录制人类执行任务时,鼓励他们自然地说话,使用“如果/那么”的逻辑,并在适当时说“别”,而不是死守僵硬的脚本。

总之:这篇论文认为,我们正在试图用“专家级”数据(重复、简单的命令)来教机器人成为“通才”(足以应对任何事情的智能)。为了解决这个问题,我们需要给它们提供更丰富、更多样的词汇,以及更好的复杂逻辑理解能力。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →