← 最新论文
🤖 machine learning

MARVL: Multi-Stage Guidance for Robotic Manipulation via Vision-Language Models

本文介绍了 MARVL,这是一个多阶段引导框架,通过对视觉 - 语言模型进行微调以实现空间与语义一致性,从而自动生成稠密奖励,与现有方法相比,显著提升了机器人强化学习任务中的样本效率和鲁棒性。

原作者: Xunlan Zhou, Xuanlin Chen, Shaowei Zhang, ShengHua Wan, Xiaohai Hu, Lei Yuan, De-chuan Zhan

发布于 2026-05-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Xunlan Zhou, Xuanlin Chen, Shaowei Zhang, ShengHua Wan, Xiaohai Hu, Lei Yuan, De-chuan Zhan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教机械臂执行一项复杂任务,比如按下按钮或打开抽屉。在机器人领域,机器人通过试错来学习,这一过程被称为强化学习。为了有效学习,机器人需要一个“老师”提供即时反馈:当它做对时给予“奖励”(如数字化的击掌),做错时给予“惩罚”。

问题在于,手动编写这些奖励规则极其困难、耗时,且难以扩展。如果你想让机器人学习新任务,就必须从头重写所有规则。

最近,科学家们尝试使用视觉 - 语言模型(VLMs)——即能同时理解图像和文字的 AI 系统——作为这些老师。这个想法很简单:向 AI 展示机器人当前的视野和文字指令(例如“按下按钮”),然后让 AI 根据图像与指令的匹配程度给出评分。

然而,论文指出,直接“开箱即用”这些 AI 老师,就像雇佣了一位非常聪明但极易困惑的向导。论文指出了这种朴素方法失败的三个主要原因:

  1. “相机角度”问题(空间定位薄弱): AI 过于关注相机看向哪里。如果相机稍微移动,即使机器人正在做完全相同的事情,AI 也会认为任务完全变了。这就像一位老师因为你移动了头部而生气,而不是因为你答错了问题。
  2. “无进展”问题(缺乏进展感知): AI 的评分剧烈波动。机器人可能正在靠近按钮,但由于随机阴影或光线轻微变化,AI 的评分却可能下降。机器人感到困惑,因为反馈与其实际进展不匹配。
  3. “错误含义”问题(语义错位): AI 有时会误解指令的含义。它可能认为只要机器人靠近任何按钮,就满足了“按下按钮”的要求,或者被背景中无关的物体分散注意力。

解决方案:MARVL

为了解决这个问题,作者创建了一个名为MARVL(基于视觉 - 语言模型的机器人操作多阶段引导框架)的新框架。可以将 MARVL 想象成一个专门的培训计划,将那个困惑的 AI 向导转变为敏锐、可靠的教练。它通过三个步骤实现这一目标:

1. “去杂乱”过滤器(场景 - 视角分解)
想象一下,你试图在电话中向某人描述一个场景,但信号不好,背景噪音不断变化。MARVL 教导 AI 将场景(机器人和按钮)与视角(相机角度)分离开来。

  • 工作原理: 它训练 AI 忽略相机的视角,只关注机器人和物体的物理现实。
  • 结果: AI 现在明白,无论相机是从左侧、右侧还是上方观看,“按下按钮”都是同一个任务。它不再被角度分散注意力。

2. “分步”地图(多阶段分解与任务方向投影)
MARVL 不再要求机器人从“开始”到“结束”一步跨越,而是将任务分解为更小、可管理的子步骤(例如,“移动到按钮”,然后“按下”)。

  • 解决的问题: 即使有高质量的相机,AI 的评分仍可能抖动。MARVL 引入了“任务方向”。想象在地板上画一条直线,从机器人的起始位置延伸到按钮。MARVL 强制 AI 只关注沿该直线的进展。
  • 结果: 它过滤掉了所有横向的干扰。如果机器人向按钮前方移动,评分上升;如果它横向移动或后退,评分保持平稳或下降。这为机器人创造了一条平滑、可靠的路径。

3. “置信度检查”(置信度阈值塑形)
有时,AI 可能会因为机器人靠近某个看起来 vaguely 像按钮的东西,而意外地给出一个微小的“点赞”。这被称为“假阳性”。

  • 工作原理: MARVL 设定了严格的置信度阈值。它规定:“如果 AI 没有 97% 的把握确认机器人确实在取得进展,则给予零奖励。”
  • 结果: 这阻止了机器人被意外奖励“欺骗”。只有当它真正做对时才会受到表扬,从而使学习过程更快、更稳定。

结果

论文在标准机器人任务集(如开门、推窗、按按钮)上测试了 MARVL。

  • 性能: 与使用原始 AI 奖励的先前方法相比,MARVL 学习这些任务的速度更快、更可靠。
  • 对比: 在许多情况下,MARVL 的表现与拥有机器人内部代码和精确坐标的“完美”老师(Oracle)一样出色。这是一个巨大的突破,因为这意味着机器人可以仅凭视觉和语言进行学习,而无需复杂的手动编码规则。
  • 鲁棒性: 即使相机角度发生变化,或者机器人外观不同(不同的机械臂模型),MARVL 仍能保持良好运行,证明它学到了任务的概念,而不仅仅是特定设置下的具体视觉技巧。

简而言之,MARVL 将强大但杂乱的 AI 工具提炼成一位精确的、分阶段的教练,能够仅用简单的语言教导机器人执行复杂的物理任务,而无需人类编写成千上万行奖励代码。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →