RePO-VLA: Recovery-Driven Policy Optimization for Vision-Language-Action Models
RePO-VLA 是一种面向视觉 - 语言 - 动作模型的恢复驱动策略优化框架,它通过区分成功、失败与恢复轨迹来训练一种以价值为条件的策略,从而在无需在线故障检测器的情况下自主纠正执行偏差,提升长视野、高接触性操作任务中的鲁棒性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个机器人烹饪一顿复杂的饭菜,或者折叠一条精致的毛巾。你给它看一段人类完美完成这些动作的视频。机器人观看、学习,并尝试模仿你。
问题:“完美食谱”陷阱
当前的机器人(称为视觉 - 语言 - 动作模型)非常擅长模仿完美的视频。但生活是混乱的。如果机器人打掉了勺子、在湿滑的地板上滑倒,或者以奇怪的角度抓杯子,它就会感到困惑。因为它仅接受过完美视频的训练,所以当事情出错时,它不知道该怎么办。它只是继续试图遵循原始的“完美”脚本,尽管情况已经改变,从而导致崩溃。这就像一个只在空旷高速公路上学过开车的司机;一旦遇到坑洼,他们便不知道如何绕行。
解决方案:RePO-VLA(“恢复教练”)
这篇论文介绍了一种名为RePO-VLA的新方法。该方法不再仅仅向机器人展示完美视频,而是教会它三件具体的事情:
- 成功:如何正确完成。
- 失败:当事情出错时会发生什么。
- 恢复:如何纠正错误并重回正轨。
这就像训练一名体操运动员。你不仅展示完美的落地动作,还展示他们摔倒的视频,以及随后他们如何自救并重新站起来的视频。机器人会明白,摔倒并非世界末日;这只是一个切换策略的信号。
工作原理:三个简单步骤
“全新开始”技巧(恢复感知初始化)
当机器人摔倒时,它往往会记住导致摔倒的那个错误。如果你让它去解决问题,它可能会陷入在脑海中重演错误的死循环。- 解决方法:RePO-VLA 截取视频中“恢复”的部分,并切掉“错误”的部分。它在修复开始之前重置机器人的记忆。这就像告诉机器人:“忘记你是怎么摔倒的。只看你现在在哪里,并想办法重新站起来。”这防止了机器人将摔倒的原因与解决方案混淆。
“进度温度计”(语义价值函数)
系统为视频中的每一个时刻分配一个“分数”。- 高分(1.0):你正在朝着目标前进。
- 低分(0.0):你正在偏离方向或即将崩溃。
- 神奇之处:如果机器人滑倒,分数会下降。但如果它开始修复滑倒,分数就会回升。机器人学会观察这个“温度计”。如果分数很低,它就知道要停止当前的计划,尝试不同的动作以让分数回升。它学会了区分“努力尝试但失败”与“真正解决问题”。
“目标导向”驱动(基于价值的细化)
当机器人在现实世界中实际工作时,系统会告诉它:“瞄准尽可能高的分数(1.0)。”- 如果机器人偏离轨道,“分数”就会下降。因为机器人被训练为追逐高分,它会自动切换到“恢复模式”以回到安全路径。它不需要人类大喊“停!”或依靠特殊传感器来检测崩溃。它只需看到分数下降,就会本能地进行自我修正。
测试:FRBench
为了证明这行之有效,研究人员建立了一个名为FRBench的测试。想象一个视频游戏,机器人试图倒水或折叠毛巾,但游戏管理员秘密地推动机器人或让物体打滑。
- 旧机器人:被推搡时,它们继续试图向空中倒水或以错误的方式折叠毛巾,最终失败。
- RePO-VLA 机器人:被推搡时,它意识到分数正在下降,停止了错误的动作,并想出了倒水或折叠的新方法,成功完成了任务。
结果
在测试中,当事情出错时,旧机器人的成功率仅为 20% 左右。而新的 RePO-VLA 机器人成功率约为 75%。在实际机器人的现实世界试验中,其成功率高达 80%。
一句话总结
RePO-VLA 教会机器人:失败只是数据。通过分解错误、重置记忆,并给机器人一个要追逐的“分数”,它将一个脆弱易碎的机器人转变为一个能够自我修复问题的坚韧机器人。这其中的区别,就像是一个只死记硬背答案键的学生,与一个学会了即使题目变化也能解决问题的学生之间的区别。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。