← 最新论文
💻 computer science

ValueFormer: A Causal Transformer Value Function with Stage-Aware Labels for Semi-Autonomous Vision-Language-Action Policies

ValueFormer 通过引入一种紧凑的因果 Transformer,生成稠密的、阶段感知的逐帧价值标签,从而实现有效的在线错误检测和优势估计,进而解决了基于模仿学习的视觉-语言-动作策略中的隐性失败问题,在无需昂贵的强化学习的情况下,显著提高了真实机器人操控任务的完成率。

原作者: Inkyu Sa, Konstantin Stulov, Rajat Bhageria

发布于 2026-08-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Inkyu Sa, Konstantin Stulov, Rajat Bhageria

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个机器人不再通过死板的规则进行编程,而是通过观察人类并模仿人类来学习家务活的世界,就像幼儿通过观察父母来学习系鞋带一样。这个领域被称为视觉-语言-动作(Vision-Language-Action, VLA),在这里,机器人利用它的“眼睛”(摄像头)和“大脑”(语言模型)来决定下一步该做什么。这种方法的一个大问题是,机器人通常只能从成功的案例中学习。这就像你只能通过观看那些从未摔倒的人骑自行车的视频来学习骑车一样。如果机器人开始摇晃或掉落车把,它直到整个过程彻底崩溃时才会意识到自己失败了。它没有内在的“直觉”来告诉它:“嘿,你做得很好!”或者“停!你快要把三明治掉下去了!”

这篇论文解决了这个缺失的“直觉”问题。研究人员想要为机器人构建第二个更小的“大脑”,充当一个进度条。这个系统不再仅仅是在任务结束时才说“做得好”或“失败”,而是实时地、逐帧地观察机器人。它试图回答:“我们现在离终点线还有多远?”以及“我们刚才是不是犯错了?”其目标是让半自主机器人变得更安全、更有用,从而让操作员不必盯着屏幕等待灾难发生。


知道你何时陷入困境的机器人“进度条”

认识一下 ValueFormer,这是一个旨在赋予机器人进度感的全新工具。想象一个机器人正在尝试制作三明治。它必须先放下面包底,加入肉饼、奶酪、番茄、生菜,最后盖上顶层面包。如果机器人在处理生菜时卡住了,一个仅靠成功案例训练的标准机器人可能会一直试图抓取生菜,或者更糟——直接跳过生菜把顶层面包盖在光秃秃的肉饼上,并认为一切正常。它完全不知道自己遇到了麻烦。

本文的作者意识到,最大的障碍并不是构建一个华丽的新机器人大脑,而是如何教会机器人如何在每一秒钟都理解什么是“做得好”。

“全或无”标签的问题

想象你正在给一名学生的数学考试评分。如果你只在最后才给他们一个分数,你就不知道他们是在何时卡住的。是第一题没做出来,还是最后一题?

  • 旧方法: 大多数机器人的训练采用简单的“成功/失败”开关。如果三明治做好了,就是 1;如果搞砸了,就是 0。
  • 缺陷: 这种标注过于稀疏。如果机器人在中途犯错但仍继续进行,最后的“0”并不会告诉机器人究竟是哪一部分出了问题。这就像告诉一名跑步者“你输掉了比赛”,却没告诉他们是在第 2 英里处绊倒的。

研究人员尝试了一种不同的方法。他们想要一种稠密标签(dense label),即一个每分之几秒就会更新一次的分数,显示机器人距离目标到底有多近。但棘手之处在于:如果你只是在整个失败的过程中告诉机器人“你失败了,所以你的分数是 0”,机器人会感到困惑。它看到前几秒(当时表现良好)时会想:“等等,我刚才表现得很好,但你却说我在失败?那我一定是从一开始就在失败!”这会让机器人感到困惑,并导致它即使在成功的尝试中表现也很差。

“阶段感知,成功后衰减”解决方案

论文的核心突破是一种被称为**“阶段感知,成功后衰减”(Stage-Aware, Success-Then-Decay)**的巧妙错误标注法。

想象机器人正在爬山(制作三明治):

  1. 攀爬期: 随着它向上爬,它的“进度得分”平滑上升。
  2. 滑坡期: 如果它打滑跌倒(犯了错),得分不会立即掉到零。相反,对于它已经做好的部分(底座面包和肉饼),得分会保持在高位,然后随着它意识到出问题了而缓慢衰减
  3. 结果: 这教会了机器人,前半部分的尝试实际上是好的,只是结尾出了问题。它为错误发生前的有效工作保留了“部分得分”。

作者将此方法与四种其他的错误标注方式(例如将分数立即降至零,或按比例缩减整个分数)进行了对比测试。他们发现,只有这种“平滑衰减”法不会让机器人感到困惑。它让机器人能够学习到:一次失败的尝试在开始阶段仍然是有价值的,从而防止了它在随后的成功尝试中出现预测“坍塌”的情况。

双头并行,一心同体

ValueFormer 是一个运行在机器人主脑旁边的轻量且高效的模型。它拥有独特的“双头”设计,就像机器人长了两双不同类型的眼睛:

  1. 平滑眼 (VmcV_{mc}):它提供一个连续、平缓的进度得分(0 到 1)。它告诉操作员:“我们完成了 60%,”或者“我们停滞不前了。”它非常适合追踪整体进度。
  2. 锐利眼 (VbinV_{bin}):这是一个二进制警报。一旦发生错误,它会立刻跳向“危险!”状态。它旨在快速捕捉错误,比如当机器人掉落生菜时,以便人类能在整个三明治被毁之前介入。

论文显示,通过在 1,427 个真实的机器人制作三明治片段上进行训练,该系统学会了识别四种截然不同的模式:

  • 完美成功:得分稳步攀升至顶峰。
  • 成功并重试:当机器人手忙脚乱时(如掉落肉饼),得分会下降,但一旦修复问题,得分又会回升。
  • 早期坍塌:得分上升后掉落并保持在低位,因为机器人在早期就搞砸了。
  • 原地打转:得分保持低位,因为机器人只是在原地空转。

现实世界的结果

当研究人员使用这个“进度条”来辅助机器人学习时,结果令人振奋。通过利用机器人自身的“直觉”来加权其训练数据(告诉它要更多地关注那些挣扎的部分),他们将三明治制作任务的成功率从 70% 提升到了 85%。他们还成功消除了一个特定的坏习惯,即机器人会反复尝试去捡起一个已经成功放置好的食材(“重复拾取”错误)。

然而,作者也谨慎地指出,虽然改进是真实的,但样本量(最终测试中的 20 个三明治)较小,因此结果是“具有启发性”的,而非一个已彻底解决的问题。他们还发现,系统需要一点反应时间(大约 5 到 10 秒),因为它需要观察一段简短的历史记录才能做出判断。

让运行足够快

最后,团队必须确保这个新的“进度条”不会拖慢机器人的速度。在同一个计算芯片上运行两个大脑是很困难的。他们发现,主要的成本不在于“思考”部分,而在于“看”的部分(处理摄像头的图像)。通过优化图像处理方式(使用“批处理”技术和一种特定的数学格式“bf16”),他们将检查进度的耗时缩减了 3 到 5 倍。这使得系统能够在与主机器人脑相同的计算芯片上以 2 Hz(每秒两次)的速度流畅运行,而不会产生任何延迟。

简而言之,ValueFormer 给机器人提供了一种表达方式,让它能说:“我做得还可以,但我刚才把奶酪掉了,我需要帮助,”而不是在结束时才默默地失败。它将盲目的模仿转变为一种知道自己何时陷入困境的半自主伙伴。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →