Task Robustness via Re-Labelling Vision-Action Robot Data
本文介绍了 TREAD,这是一个可扩展的框架,它利用预训练的视觉-语言模型对现有的机器人数据集进行重新标注和增强,使其具备多样化的语义子任务和语言多样的指令,从而在不需要额外数据采集的情况下,显著提升机器人策略在处理新任务时的规划能力和语言条件泛化能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一个机器人做一道复杂的菜,比如“做一个三明治,然后清理桌面”。你给机器人看一段人类做这些动作的视频。机器人观看整个过程并试图模仿。
根据这篇论文,问题在于目前的机器人非常难以理解我们给出的“词汇”。如果你说“拿三明治”,而你之前说的是“拿起三明治”,机器人可能会陷入停滞。这就像一个背下了考试标准答案的学生,但只要老师稍微改变一下提问方式,他就无法应对。
此外,我们拥有的训练视频通常太长且过于杂乱。机器人看到的是一段关于“制作三明治”的长视频,但它无法清晰地理解每一个单独的步骤:1. 拿面包,2. 拿奶酪,3. 把奶酪放在面包上。 它看到的只是一团模糊的动作。
于是,有了 TREAD(通过重新标注视觉-动作机器人数据实现任务鲁棒性)。
把 TREAD 想象成一个超级聪明的、由 AI 驱动的电影剪辑师和剧本作家,它能帮助我们更好地教导机器人,而无需拍摄新的视频。以下是它的工作原理,我们用一个简单的类比来说明:
三步魔术
1. “场景拆解”(分割)
想象你有一部 10 分钟长的关于某人搭建乐高城堡的电影。对于机器人来说,一次性学习整部电影太长了。
TREAD 使用一个巨大的 AI 大脑(称为视觉-语言模型)来观看这部电影,并说道:“好吧,让我们把它切成更小的场景。”
- 剪辑 1: “拿起红色积木。”
- 剪辑 2: “将红色积木放在蓝色底座上。”
- 剪辑 3: “拿起塔楼部件。”
AI 会自动将长视频切割成一个个微小的、具有特定指令含义的片段。
2. “剧本重写”(重新标注)
现在,假设机器人只知道短语“拿起红色积木”。如果你对它说“抓起红色砖块”,它就会感到困惑。
TREAD 扮演着创意作家的角色。它观察拿起积木的那个微小视频片段,并根据它实际看到的景象,写出许多种表达相同意思的不同方式。
- 原句:“拿起红色积木。”
- 新版本 A:“抓起红色的小砖块。”
- 新版本 B:“拿起位于蓝色物体旁边的红色积木。”
- 新版本 C:“握住红色物体。”
通过这样做,机器人会明白“抓取”、“拿起”和“拿”都意味着同样的意思,并且“红色积木”和“红色砖块”是同一个物体。
3. “练习环节”(训练)
最后,机器人在这个全新的、内容丰富的数据库上进行训练。它不再是看 100 段冗长乏味的视频,而是看到成千上万个清晰的短片,以及每种动作对应的数百种不同描述方式。
尝试之后的结果如何?
研究人员在名为 Octo 和 π0-FAST 的机器人学习系统上测试了该方法。他们使用了名为 LIBERO 的标准测试套件(一个虚拟的厨房和客厅环境)。
- 结果: 经过 TREAD 帮助训练的机器人,在面对从未见过的指令时表现得好得多。
- “运动”方面的胜利: 当机器人被放到一个新房间(新环境)但被要求执行熟悉任务时,它的成功率大幅提升。这就像是一个学会了“打开抽屉”这一概念的学生,而不是仅仅记住了某个特定抽屉的手柄。
- “语言”方面的胜利: 当研究人员改变询问机器人的方式时(例如,说“把杯子放在桌子上”而不是“将杯子放置在桌面上”),经过 TREAD 训练的机器人能立即理解。而旧的机器人往往会卡壳。
核心结论
论文声称,你不需要花费数月时间去拍摄新的机器人视频来让它们变得更聪明。相反,你可以利用现有的视频,使用强大的 AI 将其拆解为小的步骤,并以多种不同的方式重写指令。
这使得机器人更加鲁棒(Robust)——这意味着它可以处理新的房间和新的说话方式,而不会陷入恐慌。这就像是给了机器人一本字典和一张地图,而不仅仅是一个单一且僵化的剧本。
注意局限性: 作者承认,他们的方法依赖于特定的、功能强大的 AI(Gemini),而该 AI 是不开源的,这使得其他人很难完全复制。然而,核心观点——即拆解任务和多样化语言有助于机器人学习——才是主要的收获。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。