StellaVLA: In-Context Structured Demonstration for Generalizable Vision-Language-Action Models
StellaVLA 是一个用于视觉-语言-动作(Vision-Language-Action)模型的测试时自适应框架,它利用零成本、结构化的演示(例如任务规划和语言化的 3D 运动)作为上下文指导,以增强跨分布外场景和具身形态的泛化能力,在不增加推理延迟的情况下,在主要基准测试上实现了最先进的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个机器人做三明治。你可以给它看一段你做三明治的视频,机器人可能会尝试完全模仿你的手部动作。但如果机器人在一个不同的厨房里,面包在左边而不是右边,或者机器人的手臂类型不同了呢?突然间,机器人就陷入了混乱并掉落了面包。这在视觉-语言-动作(VLA)模型这一类型的智能系统领域是一个大问题。这些模型就像是超级聪明的机器人,它们能“看到”一张图片,能“读懂”像“拿起杯子”这样的指令,然后通过“行动”来移动它们的机械臂。问题在于,它们往往像那些只靠死记硬背考试题、一旦题目稍有变化就会失败的学生。当场景发生变化、出现新物体或摄像机角度偏移时,它们会感到困惑。为了解决这个问题,科学家通常必须收集数以千计的新视频并重新训练机器人,这非常耗时。
但如果机器人只需看一眼别人完成这项任务的一个例子,就能立刻理解他们为什么要这样做,而不仅仅是做了什么,那会怎样呢?这正是这篇论文试图解决的核心问题。研究人员不想只是向机器人展示一段手部移动的原始视频,而是想给机器人一份解释其动作逻辑的“参考指南”。他们希望机器人学习的是“计划”(比如“先抓取把手”),而不是仅仅学习“像素”(比如“将手移动到坐标 X, Y, Z”)。如果他们能做到这一点,机器人或许就能在面对新奇、怪异的情况时,而不需要进行彻底的重启。
于是有了 StellaVLA,这是来自 StellarEdge AI 技术团队的一个新框架,旨在解决这个确切的问题。你可以把 StellaVLA 想象成一个不仅在看电影,还在阅读导演解说词的机器人。
它是如何工作的:该团队构建了一个系统,可以将机器人或人类执行任务的杂乱、原始的视频自动转化为结构化演示。想象一下,将一段关于某人搭建乐高城堡的长篇且混乱的视频,转化为一份清晰的、分步骤的说明书。该系统将任务分解为“子目标”(如“找到红色的积木”)并将动作用通俗易懂的语言进行描述(如“将手臂向上并向右移动”)。这个过程是自动完成的,无需人类手动记录笔记,而是利用强大的 AI 来“阅读”视频并编写故事。
一旦这些“基于故事”的示例准备就绪,它们就会被存储在一个库中。当机器人面临新任务时,它不会盲目猜测。它会搜索这个库,找到最匹配的故事,并将其作为引导。但这里有一个巧妙之处:机器人的训练方式很特别。在它的“求学”期间,它必须同时做两件事:它既要学习如何移动手臂(行动),也要学习如何用语言解释这种运动(推理)。这就像一个学生在做数学题的同时,还必须写出解题步骤才能获得满分。这迫使机器人去理解任务的“逻辑”,而不仅仅是模仿动作。
然而,论文对于这在现实世界中是如何运作的做了一个非常重要的区分。虽然机器人在训练时是通过“自言自语”来学习的,但在实际执行任务(推理)时,它会停止说话。它大脑中“解释者”的部分会被关闭,只有“执行者”部分保持活跃。为什么要这样做?因为说话需要时间,而机器人需要快速移动。通过在实际工作中关闭“喋喋不速”的部分,机器人可以保持极高的速度和响应能力,但它依然能从学习过程中获得的深度理解中获益。
这种方法的结果非常令人期待,至少在研究人员进行的测试中是如此。在名为 LIBERO 的一系列模拟测试中,机器人的成功率达到了 98.8%,这是一个非常高的数值。当他们在更具挑战性的排行榜 VLA-Arena 上进行测试时(该排行榜包含了一些棘手的场景,如新物体或复杂的背景),StellaVLA 的综合得分达到了 0.63。这击败了其他表现强劲的模型,后者的得分大约在 0.44 和 0.22 左右。即使在面对奇怪的光照、不同的摄像机角度或从未见过的物体(例如把胡萝卜放进碗里,但胡萝卜的颜色变了)时,它的表现也比竞争对手更稳健,在名为 LIBERO-Plus 的鲁棒性测试中得分达 85.1%。
研究人员还在真实的机器人手臂上进行了实地测试。他们发现,机器人可以使用来自人类、其他机器人甚至虚拟现实(XR)模拟的演示作为其引导。无论“老师”看起来有什么不同,只要任务的“故事”足够清晰,机器人就能遵循。例如,当被要求将积木放入一个它从未见过的抽屉时,机器人并没有直接失败,而是取得了进展,平均得分达到了 1.9(总分为 4),这表明即使它无法完美完成任务,也在努力遵循计划。
不过,论文也谨慎地指出,这并不是解决所有问题的“万灵药”。在处理非常长且复杂的任务(例如如果有人走进来并移动了积木,导致机器人需要中途改变计划)时,机器人仍然会遇到困难。在这些“长程任务(long horizon)”测试中,成功率显著下降,这表明虽然机器人擅长遵循预先写好的故事,但它还没有准备好在现场即兴创作全新的情节。此外,论文指出,虽然机器人在使用不同类型的演示(人类 vs 机器人)时表现得非常一致,但在现实世界的测试中,它仍然需要正确类型的引导才能完美工作。
简而言之,StellaVLA 表明,如果你想让机器人变得聪明且具有适应性,你不应该只是展示给它做什么,而应该告诉它为什么要这样做。通过将原始视频转化为结构化的、逻辑性的故事,并教会机器人理解其中的逻辑,该系统在处理新颖和棘手的场景时变得更加出色。这是迈向“不仅能模仿我们的动作,而且能理解我们的意图”的机器人的一大步。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。