← 最新论文
🤖 AI

VGAS: Value-Guided Action-Chunk Selection for Few-Shot Vision-Language-Action Adaptation

本文介绍了 VGAS,一种由价值引导的动作块选择框架,它通过将高召回提议生成器与基于几何的评判器相结合,并引入显式几何正则化,以解决歧义并提升在有限监督下的鲁棒性,从而增强少样本视觉 - 语言 - 动作的适应能力。

原作者: Changhua Xu, En Yu, Junyu Xuan, Jie Lu

发布于 2026-05-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Changhua Xu, En Yu, Junyu Xuan, Jie Lu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人通过视频摄像头和语音指令抓取特定物体(比如一个罐子)。你只有时间向机器人展示五次如何操作的示例。这就是“少样本”问题:从极少量的演示中学习复杂的物理技能。

本文介绍了一种名为VGAS(价值引导的动作块选择)的新方法,旨在解决机器人试图从这些少量示例中泛化时失败的问题。

以下是其工作原理的分解,使用简单的类比说明:

问题:“差之毫厘”的错误

当前的机器人使用“视觉 - 语言 - 动作”(VLA)模型。可以将此模型想象成一位非常聪明的学生,他阅读了数百万本关于机器人的书籍(预训练),但只看过五个关于抓取罐子的具体视频(微调)。

当你要求这位学生在与视频所示位置略有不同的地方抓取罐子时,他们通常能理解概念(“我需要抓住罐子”)。然而,他们往往在几何精度上失败。

  • 类比:想象这位学生试图将飞镖投向靶心。他们知道需要瞄准中心(语义),但由于练习不足,投掷会略有偏差。他们可能会偏离一英寸。
  • 后果:在现实世界中,偏离一英寸意味着机器人的手击中了桌子而不是罐子,或者抓得太松。论文将这些称为“差之毫厘”的动作。它们在理论上看起来正确,但在实践中却失败了。

解决方案:“多试几次,择优录取”策略

VGAS 不再试图强迫机器人每次猜测都完美,而是改变了策略。它将工作分为两部分:生成选择

1. 生成器(“创意梦想家”)

首先,机器人利用其标准训练生成许多可能的移动手臂方式(称为“动作块”)。

  • 类比:想象机器人正在进行一场头脑风暴。它迅速勾勒出 10 种它可能抓取罐子的方式。其中大多数草图还可以,但有些略有偏差。这里的目标仅仅是提出大量想法(高召回率)。

2. 评判者(“几何法官”)

这是核心创新。论文引入了一位特殊的“法官”(一个名为Q-Chunk-Former的神经网络),它查看所有 10 张草图并选出唯一最好的那一张。

  • 旧法官的问题:以前的法官过于严格。他们会说:“这张草图与训练视频不完全一样,所以是坏的”,并拒绝所有不是完美复制品的选项。这就像一位老师,如果任何文章没有使用与教科书完全相同的词语,就给它打不及格。
  • VGAS 法官:VGAS 法官更聪明。它理解机器人在几何(距离、角度、位置)上需要精确。它查看 10 张草图并说:"3 号草图略有偏差,但 7 号草图非常接近完美路径。”它选择了 7 号。

秘密武器:“显式几何正则化”(EGR)

既然法官只看过五个视频,它是如何学会如此精确的?论文引入了一种特殊的训练规则,称为显式几何正则化(EGR)。

  • 类比:想象你在教学生画一个圆。
    • 旧方法:你给他们看一个完美的圆。如果他们画了一个稍微压扁的圆,你说“错”。如果他们画了一个稍微大一点的圆,你说“错”。他们学会只复制他们看到的那个精确的圆。
    • VGAS 方法(EGR):你给他们看完美的圆,但也告诉他们:“如果你的圆稍微有点压扁,那还可以,但压扁得越厉害,‘分数’就越低。”你创造了一个平滑的山谷状评分。完美的圆位于谷底(最佳分数)。稍微压扁的圆在山上稍高一点。糟糕的圆则在山顶很高的地方。
    • 结果:机器人了解到存在一个质量的“平滑斜坡”。即使不是完全的训练示例,它也能选择最接近谷底的那个候选项。这防止了“价值景观”的崩塌,即所有选项看起来都同样糟糕。

实际运作方式

  1. 采样:机器人生成 10 个不同的移动计划(动作块)。
  2. 评分:“几何法官”根据每个计划接近完美物理执行的程度进行评分,而不仅仅是看它多么符合文本指令。
  3. 选择:机器人选择得分最高的计划并执行它。

结果

作者在名为LIBERO的基准测试中对此进行了测试,该测试涉及机器人将物体移动到特定位置等任务。

  • 结果:在“5 次样本”场景(仅 5 个示例)中,标准机器人成功率约为40%。VGAS 机器人的成功率约为49%
  • 重要性:虽然百分比的提升看起来很小,但在机器人领域,可靠性提高 10% 是巨大的。这意味着当情况发生轻微变化时,机器人掉落物体或撞到其他东西的可能性要小得多。

总结

VGAS就像给机器人配备了一双“第二双眼睛”,专门负责物理精度。它不再指望机器人的第一次猜测就是完美的,而是生成许多猜测,并利用一位专门的法官选出在几何上最接近成功的那一个。这使得机器人能够从极少量的示例中学习新的物理任务,而无需在第一次尝试时就做到完美。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →