RedFlow: Redirect Failure into Action-Level Corrections for Flow-matching VLA Policy
RedFlow 是一个细粒度的离线强化学习框架,它通过将失败经验转化为动作层级的纠偏监督,增强了流匹配视觉-语言-动作策略,从而显著提高了与现有方法相比的现实世界成功率和样本效率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个机器人做家务,比如折叠一件衬衫或清扫地板。你向它展示人类完美完成任务的视频,然后机器人尝试模仿他们。这被称为“模仿学习”(Imitation Learning)。当机器人在熟悉的房间里时,这种方法效果很好,但现实生活是混乱的。有时机器人会掉落衬衫,或者扫帚会被卡住。在过去,当机器人犯错时,它会不断重复同一个错误的动作,情况变得越来越糟,直到彻底放弃。这是因为机器人只被告知了“这样做失败了”,但并没有被给予关于“如何修复它”的具体指令。
迎来强化学习(Reinforcement Learning, RL),这是一种机器人通过尝试并根据成功获得奖励或失败受到惩罚来学习的方法。通常,这需要机器人在现实世界中练习数百万次,这既缓慢、昂贵又具有风险(想象一下机器人在学习打扫时弄碎了一个花瓶)。最近,一种被称为“流匹配 VLA”(Flow-matching VLA,即视觉-语言-动作模型)的新型机器人大脑出现了。你可以把它想象成一位超级聪明的艺术家,能够从混乱的起点到完美的终点,画出一条平滑且连续的路径。然而,即使是这些聪明的艺术家,在遇到从未见过的场景时也会感到吃力,从而导致同样的“复合误差”(compounding errors),即一个小错误会导致一场彻底的灾难。
这就是新的论文 RedFlow 出场的地方。研究人员提出了一个简单但棘手的疑问:我们能否教会机器人从自身的失败中学习,而不需要人类每次都介入去修复它?他们不仅仅想让机器人知道“那很糟糕”;他们还想让机器人明确知道哪个动作不好,以及应该用什么动作来代替。
问题所在:名为“错误动作”的黑盒
想象一下你在学习骑自行车。你摔倒了。传统的机器人学习系统可能只会说:“好吧,摔倒是不好的。别摔倒。”但它并没有告诉你为什么会摔倒。是因为你向左倾斜得太厉害了吗?是因为你踩踏太用力了吗?还是因为你在看松鼠?
在机器人学习的世界里,“失败的轨迹”(failed trajectory)就像是一段以摔车结束的整个骑行视频。旧的方法会观察整个视频并说:“整个过程都是失败的。”它们会试图避免做任何看起来像那段视频的行为。但问题在于:也许前 90% 的路程都很完美,只有最后 10%(摔车)是糟糕的。如果你告诉机器人要避免整个过程,它可能会忘记如何踩踏或转向,即便那些部分表现得很好。这就像是在告诉一个学生:“不要写那篇论文,”仅仅因为最后一句话有一个拼写错误,尽管文章的其他部分写得非常精彩。
其他方法试图通过询问人类来解决这个问题:“嘿,那个动作错了,试试这个。”但要求人类观看每一次失败的尝试并给出具体的建议,既缓慢又无法规模化。我们需要一个能自己发现错误并纠正错误的机器人。
解决方案:RedFlow 的“聪明侦探”
论文作者提出了 RedFlow(将失败重定向为动作级修正)。把 RedFlow 想象成一个超级聪明的侦探,它观察机器人的失败尝试,并找出机器人究竟在哪里脱离了轨道。
它是如何工作的,主要分为两个核心技巧:
1. “上下文感知修正匹配”(侦探的笔记本)
当机器人失败时,RedFlow 不仅仅盯着那次“撞车”。它会观察撞车发生前的一刻。它会问:“机器人当时在做什么?它在哪里?任务进行到哪一步了?”
- 类比: 想象你正在尝试折叠一件衬衫,结果把它掉落了。RedFlow 会观察你掉落的那一刻并说:“啊,你当时是用右手拿着衬衫,而且衬衫已经折了一半了。”
- 然后,它会进入它的记忆库(一个包含过去尝试记录的数据库,其中也包括成功的尝试),并在其中搜索其他机器人处于完全相同情况(用右手拿着折了一半的衬衫)但成功完成了任务的时刻。
- 它会找到一个来自相似情境的成功动作——比如改用左手去抓衬衫。它不只是说“不要掉落它”;它会说:“当你处于这个特定位置时,尝试使用你的左手。”这被称为寻找一个“修正目标”(corrective target)。
2. “自适应重定向目标”(教练的哨声)
一旦 RedFlow 找到了正确的“修复方案”(比如左手抓取),它就需要教会机器人如何去做。它使用一种带有三种不同声音的特殊训练方法:
- 啦啦队: 它说:“做得好!做得好的部分请继续保持!”(强化成功的动作)。
- 停止标志: 它说:“嘿,那个导致掉落的特定动作?别再做了!”(抑制错误的动作)。
- 引导员: 它说:“与其掉落,不如像我们在记忆库中看到的那样,尝试用左手把它拉过来!”(将失败重定向至修复方案)。
这与那些只说“不要做坏事”的旧方法不同。RedFlow 会积极地推动机器人走向一个更好的动作,就像教练物理性地引导球员的手臂到达正确位置一样。
研究发现:从笨拙到胜任
研究人员通过两种方式测试了这个想法:一种是在包含许多不同任务的计算机模拟中(使用 LIBERO 基准测试),另一种是在一个拥有双臂的真实物理机器人上。
- 在模拟实验中: 他们将 RedFlow 与其他智能机器人学习方法进行了对比。结果显示,RedFlow 在修复错误方面表现得更好。平均而言,它将机器人的成功率从约 56.2% 提升到了 68.2%。在需要机器人达到特定目标的任务中,它的表现尤为出色,成功率从 51.8% 提升到了 71.2%。
- 在真实机器人上: 他们让 RedFlow 处理三个高难度任务:折叠衣服、清扫物体和清洁桌面。
- 在使用 RedFlow 之前,机器人折叠衣服的成功率仅为 36.0%。
- 使用 RedFlow 后,成功率跃升至 67.0%。
- 在所有真实世界的任务中,整体成功率从 56.7% 提升到了 74.7%。
最令人兴奋的部分是观察机器人学习“恢复”的过程。在一段视频中,机器人正在折叠一件 T 恤。衬衫从它的右手中滑落了。一个普通的机器人会继续尝试用右手去抓,然后再次失败。但经过 RedFlow 训练的机器人意识到:“等等,我用右手够不到它。”于是它接着使用左手将衬衫拉回触及范围内,然后继续折叠。这并不是由人类编程的;机器人是通过分析自己的过往失败并从记忆中寻找替代方案来自己悟出来的。
为什么这很重要
RedFlow 最棒的地方在于它极其高效。通常,为了教会机器人如何从错误中恢复,你可能需要让它在现实世界中进行数百万次的“在线练习”,这既耗时又容易损坏设备。RedFlow 通过巧妙地利用已有的“坏数据”,将其转化为学习机会的宝库,实现了与那些“在线”方法相当的效果,但使用的训练样本却减少了约 10 倍。
该论文表明,通过将失败视为寻找更好解决方案的地图,而非应被丢弃的垃圾,我们可以让机器人变得更加稳健且更具能力。这是迈向让机器人不仅能模仿我们,还能通过从自身的踉跄中学习来更好地完成工作的关键一步。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。