RynnValue: Scaling Robotic Value Foundation Models with Temporal Distance
RynnValue 是一个开源的机器人价值基础模型,它通过使用时间距离作为监督目标,将规模扩展至数百万个指令调节的视频片段,在评估中超越了基于偏好的方法,并在无需显式奖励或进度标注的情况下,显著提升了现实世界策略的成功率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一个机器人做饭,但你并没有给它食谱,只是对它说:“做得好一点!”并寄希望于它能自行搞定剩下的部分。这就是机器人学习(robot learning)的世界——这是一个研究人员试图教会机器人在物理世界中移动和交互的科学分支。最大的障碍通常不是机器人的“大脑”(它的移动能力),而是奖励(reward)。在人工智能的世界里,“奖励”就像是一个记分卡或是一个击掌,告诉机器人:“做得好!”或者“再试一次。”问题在于,为机器人的每一个动作都给出一个完美的记分卡是极其困难的。如果记分卡太模糊,机器人会感到困惑;如果记分卡过于针对某一项特定任务,机器人就无法学习任何新事物。科学家们一直试图构建一种适用于任何机器人执行任何任务的“通用型”记分卡,但一直卡在如何创造这种记分卡而不必依赖人类手动为每一次尝试打分的问题上。
这就是名为 RynnValue 的新想法出现的地方。把它想象成一种新的评价机器人表现的方式。与其问“你离终点线还有多远?”(如果终点线在每个任务中看起来都不一样,这很难衡量),RynnValue 问的是:“距离你完成还有多少时间?”它将机器人的旅程视为一个倒计时器。如果机器人离目标还很远,计时器就很高;如果接近目标,计时器就很低。这篇论文的魔力在于,它展示了你不需要人类按下按钮说“做得好”来创建这个计时器。你只需要看时钟即可。如果一段机器人烹饪的视频从 10 分钟开始到 0 分钟结束,计算机可以自动计算出在 5 分钟处,机器人还剩 5 分钟。这个简单的技巧让机器人能够从数千小时的视频中学习,而无需任何人手动进行评分。
问题所在:“进度”陷阱
长期以来,科学家们尝试通过测量“进度”来教导机器人。想象一个机器人正在尝试堆叠积木。一个进度模型会试图猜测机器人是完成了 10%、50% 还是 90%。但问题在于:“完成了一半”对于堆叠积木和对于倒水来说,看起来完全不同。一个机器人可能通过高度判断自己完成了进度,而另一个机器人可能通过时间判断。这使得训练一个能做许多不同事情的机器人变得非常困难,因为“进度”的定义随着任务的变化而改变。这就像是在教学生数学时,只说“你已经完成了一半了!”,却从未告诉他们最终答案应该是多少。
本文作者认为这种“进度”方法是一个死胡同。他们认为我们应该停止猜测机器人进展到了多远,而是开始倒计时直到工作完成。他们称之为时间距离(temporal distance)。它是“前往目标的成本”,或者简单来说,就是“我还有多少时间?”
解决方案:RynnValue 与神奇时钟
阿里巴巴达摩院和虎扑实验室(Hupan Lab)的团队构建了一个名为 RynnValue 的模型。RynnValue 不再试图猜测进度的百分比,而是观察一段机器人视频和一段文本指令(例如“把杯子放在桌子上”),并预测距离任务完成精确还有多少秒。
这里最巧妙的部分在于:他们不需要人类为每个视频写下“还剩 5 秒”之类的话。他们直接使用了视频文件自带的时间戳(timestamps)。如果一段视频从 0:00 开始,机器人在 0:10 完成,那么计算机就知道在 0:05 时,机器人还剩 5 秒。这意味着他们可以在一个包含超过 7,000 小时机器人视频(约 300 万个片段)的海量库中训练该模型,而无需任何人工手动评分。这就像是通过让学生观看带有字幕的成千上万部电影来教他们阅读,而不是由老师去评判他们读出的每一个句子。
投机取巧的小把戏(以及如何阻止它们)
你可能会想:“如果机器人只是学会了看时钟,那它是不是在利用捷径?”科学家们也担心过这一点。他们知道,如果只是按顺序向机器人展示视频,机器人可能会学会一种捷径:“哦,视频的第 3 帧总是处于完成了一半的状态!”或者“如果视频长 10 秒,中间位置总是剩 5 秒。”这样机器人就会停止观察实际的机械臂,而仅仅根据视频的位置进行猜测。
为了阻止这种情况,他们在训练中加入了些“混乱”:
- 随机采样(Random Sampling): 他们没有按直线向机器人展示视频。他们挑选视频中的随机时刻,这样机器人就无法根据帧的顺序来猜测时间。
- 洗牌(Shuffling): 他们有时会倒序或以乱序向机器人展示视频。如果机器人看到了“完成”状态出现在“开始”状态之前,它就必须意识到“完成”状态实际上在时间上更远,从而迫使它真正去观察机器人的图像,而不仅仅是观察图像的顺序。
- 隔离(Isolation): 他们确保机器人在猜测当前帧时,无法偷看下一帧的答案。它必须独立解决每一个时刻的问题。
结果:它奏效了吗?
团队在许多它从未见过的不同机器人和任务上测试了 RynnValue。结果令人惊喜。
- 排序任务: 当被要求将不同的机器人尝试从“最好”到“最差”进行排序时,RynnValue 得到了 0.675 的分数。这优于之前依赖人类手动对视频进行评分的最佳模型(其得分为 0.655)。
- 现实世界机器人: 他们将该模型用于教导真实的机器人完成棘手的任务,比如把面包放入篮子或用铲子移动牛排。
- 使用 RynnValue 进行在线学习(移动过程中)时,机器人的成功率达到了 72.5%。
- 而使用旧有的最佳方法时,成功率仅为 52.5%。
- 在离线学习(从过去的动作数据库中学习)中,RynnValue 将成功率从 63.8% 提升到了 82.5%。
为什么这很重要
这篇论文最令人兴奋的地方在于,它表明我们不需要在评分机器人方面做到完美才能教导它们。我们只需要知道它们何时完成即可。通过使用简单的、自动化的“时钟”时间,RynnValue 为机器人创造了一种通用的语言。无论是拥有双臂的机器人、带轮子的机器人,还是带手部的机器人,只要我们能判断任务何时结束,它都能适用。
作者谨慎地指出,这并不是一个能瞬间解决所有机器人问题的魔杖。他们发现,对于需要精确对齐的极难任务(如将盒子放入抽屉),由于视觉线索容易产生混淆,模型仍然会遇到一些困难。但总体而言,他们证明了时间距离是一种强大且可扩展的教导机器人的方式。它将“什么是好的动作?”这个混乱且困难的问题,转化为了“还剩多少时间?”这个简单且可解决的问题。
简而言之,RynnValue 就像是给了机器人一个秒表,而不是一份成绩单。它将混乱的机器人学习世界变成了一个简单的倒计时,而且看起来它比旧的方法效果更好。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。