← 最新论文
💻 computer science

Semi-Supervised Vision-Language-Action Model

本文提出了 SemiVLA,这是一个通过利用可靠性控制器和瓶颈投影更新来从无标签轨迹中生成高质量伪动作,从而增强视觉-语言-动作模型半监督自适应能力的自蒸馏教师-学生框架,该框架在仅使用极少量有标签数据的情况下,显著提升了机器人在 LIBERO 和 CALVIN 等基准测试上的性能。

原作者: Hongyang He, Jiuming Liu, Victor Sanchez

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Hongyang He, Jiuming Liu, Victor Sanchez

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在试图教一个机器人做家务,比如“拿起红色的杯子并把它放在桌子上”。

问题所在:昂贵的老师
通常,要教机器人完成这项任务,你需要用手物理地握住机器人的手臂,引导它完成成千上万次的动作,记录下每一次细微的移动。这就像是为每一节课都聘请一位私人导师。这极其昂贵、缓慢且难以实现。

然而,我们拥有大量的“廉价”数据。我们可以轻松地记录下机器人伴随语音指令(如“拿起杯子”)进行活动的视频,但我们并没有这些视频中详细的动作数据。这就像是在看一段厨师烹饪的视频,却不知道具体的食谱或手部动作。

解决方案:SemiVLA(智能实习生系统)
论文介绍了一种名为 SemiVLA 的新方法。你可以将其视为一种“师徒制”系统,旨在利用这些廉价的无标签视频进行学习,而不需要人类去引导每一个步骤。

它是这样运作的,我们使用一个简单的类比:

1. 设定:学徒与大师

  • 学徒(学生): 这是正在学习中的机器人大脑。它首先通过学习少量由人类引导的“完美”示例(即昂贵的数据)开始。这让它对如何移动有一个基本的概念。
  • 大师(老师): 一旦学徒有了基本概念,我们就创造出一个“大师”版本的它。大师的任务是观察那些廉价的、无标签的视频,并猜测机器人在这些场景中应该在做什么。这些猜测被称为伪动作(pseudo-actions)

2. 挑战:“幻觉”陷阱

如果仅仅让大师进行猜测,它可能会犯错。它可能会做出一个在镜头里看起来还可以,但在物理上却无法实现的动作(例如,试图用一根手指去举起重物),或者与语音指令不符(例如,在被要求拿起红杯子时,却去拿蓝杯子)。

在标准的 AI 学习中,我们通常会在 AI 说“我有 90% 的把握”时就信任它。但对于机器人来说,仅仅“自信”是不够的。机器人可能会对一个会导致其发生碰撞的动作表现得非常自信。

3. 创新:“质量控制检查员”

这是该论文最大的贡献。SemiVLA 加入了一个 可靠性控制器(Reliability Controller)(可以将其想象为一个严格的质量控制检查员)。在学徒从大师的猜测中学习之前,检查员会检查三件事:

  1. 视觉-语言匹配度: 猜测是否真的符合视频内容和语音指令?(例如:机器人是否真的在伸手拿那个红色的杯子?)
  2. 物理可行性: 这个动作在物理上是否可行?(例如:机器人的手臂移动速度是否超过了人类极限?)
  3. 时间一致性: 这个动作在时间维度上是否合理?(例如:如果机器人的手向左移动,下一帧画面中手的位置是否在更左边,还是发生了随机跳变?)

如果大师的猜测未能通过其中任何一项检查,检查员就会将其丢弃。学徒只从这些“金标准”级别的猜测中学习。

4. 反馈循环:“过滤更新”

通常,当学徒学到新东西时,它会告诉大师:“嘿,我掌握了这个!”然后大师也会随之更新。但如果学徒学到了错误的东西,它会把大师也带偏。

SemiVLA 使用了一种特殊的 瓶颈投影更新(Bottleneck-Projected Update)。想象一下,大师和学徒之间通过一根狭窄的管道连接。这根管道只允许那些“稳定”且“对齐”的更新通过。

  • 如果学徒学到了一个不稳定的视觉技巧,管道会将其阻挡。
  • 如果学徒学到了一个精确且符合物理规律的动作,管道则会允许其通过。

这确保了大师在变得更聪明的同时,不会被嘈杂或错误的猜测所“迷惑”。

结果:以少胜多

论文在多个机器人基准测试(如 LIBERO 和 CALVIN)上进行了测试。

  • 基准线(Baseline): 如果仅使用那些“完美”的昂贵数据(总量的 10%),机器人的成功率约为 81%
  • 新方法 (SemiVLA): 通过使用这 10% 的完美数据,加上那 90% 经过检查员过滤后的廉价无标签视频,机器人的成功率跃升至 89%

总结
SemiVLA 是一个通过使用严格的质量控制系统,教机器人从“草稿”(无标签视频)中学习的系统。它防止了机器人养成坏习惯,使其无需人类引导每一个动作就能更好地完成任务。这就像不仅是通过给学生提供标准答案来教学,而是通过让他们在一位严厉的导师指导下练习,而这位导师只允许他们学习正确的步骤。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →