← 最新论文
🤖 machine learning

Leveraging Offline Supervision for Efficient and Generalizable Reinforcement Learning in Large-Scale Vision-Language-Action Models

本文证明了通过利用离线监督来正则化在线强化学习的混合训练方法,在实现接近标准强化学习的分布外性能的同时,显著提高了训练效率,实际上仅需一半的训练预算。

原作者: Dmitriy Poyarkov, Aleksei Staroverov, Aleksandr I. Panov

发布于 2026-07-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Dmitriy Poyarkov, Aleksei Staroverov, Aleksandr I. Panov

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一个机器人完成一项复杂的任务,比如做三明治或叠衣服。在人工智能的世界里,教导机器人的主要方式有两种。第一种是模仿学习(Imitation Learning),这就像是递给机器人一段人类完美完成任务的视频,并对它说:“完全照着这个做。”这种方法成本低、容易上手,但如果情况发生哪怕一点点变化——比如面包从左边换到了右边——机器人就会感到困惑。第二种是强化学习(Reinforcement Learning, RL),这就像是让机器人一遍又一遍地尝试这项任务,当它做得好时,给它一个击掌(奖励),当它失败时,给它一个温柔的“再试一次”。这种方法在教机器人应对各种新奇、古怪的情况方面表现卓越,但它极其昂贵且缓慢,因为机器人在虚拟世界中需要进行数百万次的练习才能变得熟练。

现在科学家们提出的核心问题是:我们能否兼得两者的优点?我们能否利用那些廉价、简单的练习视频让机器人入门,然后再利用那些昂贵、缓慢的练习环节来对其进行精细调整,从而不浪费所有的时间和金钱?这篇论文深入探讨了正是这样一个问题,特别是针对一种新型的超智能机器人大脑——“视觉-语言-动作”(Vision-Language-Action)模型。这类模型能够观察图像、理解句子并决定采取什么行动。研究人员想要观察,将这种“模仿者”风格与“试错”风格结合起来,是否能让机器人学得更快,同时又不损失其应对突发状况的能力。


“教练” vs. “独行侠”

研究人员设计了一个巧妙的实验,旨在测试如果机器人在练习时有一个“教练”在一旁观察,它的学习效果是否会更好。他们使用了一种特定类型的机器人大脑,叫做 OpenVLA,它就像是一个关于世界运作规律的庞大预训练知识库。

首先,他们使用“模仿者”方法(称为监督微调SFT)来教导机器人。他们向机器人展示了 2,000 个人类执行任务的示例。这为机器人打下了坚实的基础,就像一个背熟了教科书的学生。但正如预期的那样,这个机器人显得有些僵化。如果你改变了房间或工具,它就会陷入挣扎。

接下来,他们尝试了“试错”方法(称为强化学习RL)。他们让机器人在模拟世界中独立练习。这个机器人最终在处理奇怪情况(如一种新型号的杯子或不同的光照)时变得非常出色,但它花费了很长时间才达到这个水平。它大约需要 200 万个练习步骤才能达到巅峰性能。

重大发现:混合方法

团队随后提出了疑问:如果我们让机器人进行自主练习,但同时也给它一个“教练”在旁边低声提示,会怎样呢?他们测试了两种类型的教练:

  1. 参考教练(The Reference Coach): 一个处于“冻结”状态的“模仿者”机器人,它永远不会改变。练习中的机器人被告知:“尽量像我一样,但如果你需要,也可以做出改变。”
  2. 数据教练(The Data Coach): 练习中的机器人会在练习过程中反复观看原始的视频示例,并被告知:“还记得人类在这里是怎么做的吗?”

结果令人惊叹。拥有“教练”指导的机器人学习速度比独自练习的机器人快了一倍

这里有一个神奇的数字:拥有“教练”指导的机器人仅需 100 万步就达到了“独行侠”机器人的技能水平,而“独行侠”则需要 200 万步才能达到。更令人印象深刻的是,拥有“教练”指导的机器人在处理奇怪的新情况(即分布外任务,OOD 任务)时,表现得与“独行侠”一样出色,但它们达到这一水平的时间缩短了一半。

为什么“参考教练”表现最好

研究人员发现,其中一种教练的效果更为出色。参考教练(冻结模型)是最有效的。它像一只稳健的手,在机器人的早期动作中起到引导作用。它防止机器人在摸索新规则的过程中养成坏习惯。

数据教练(重新阅读视频)也提供了帮助,但它显得有些死板。它似乎让机器人过于专注于模仿旧视频,导致机器人在面对极其陌生的情况时,适应能力略显不足。

有趣的是,他们还尝试了直接从“模仿者”的大脑开始进行“独行侠”式的练习,而不提供任何额外的教练指导。这个机器人起步很强,但后来卡住了。它就像一个把教科书背得太熟的学生,以至于不敢尝试用新的方法去解决问题。与有教练指导的机器人相比,它的进步非常缓慢。

这对未来意味着什么

这篇论文表明,我们不必在“廉于成本但难以适应”和“昂贵但适应力强”之间做单选题。通过使用混合方法——即从一个良好的基础开始,然后使用“教练”来引导昂贵的练习过程——我们可以兼得两者的优势。

研究人员谨慎地指出,这项测试是在一个特定的受控环境(具有特定任务的模拟环境)中进行的。他们并没有声称已经解决了宇宙中所有的机器人问题,但他们展示了一条非常有前景的路径。他们发现,离线监督(教练)不仅能提供一个更好的起点,还能积极地稳定学习过程,防止机器人在学习如何变得灵活时,遗忘掉已有的知识。

简而言之,如果你想要一个既聪明又具备适应能力的机器人,不要只是让它在黑暗中盲目摸索。给它一位好老师,让它去练习,并在它找到自己的节奏之前,始终用一只稳健的手扶住它的肩膀。这种方法可以使训练先进机器人的成本更低、速度更快,让我们离家中有用、好用的机器人更近一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →