FrameSkip: Learning from Fewer but More Informative Frames in VLA Training
本文介绍了 FrameSkip,这是一个数据层框架,通过基于动作变化和视觉连贯性选择性地采样高重要性帧来提升视觉 - 语言 - 动作(VLA)训练的效率和性能,在仅保留原始轨迹 20% 帧的情况下,在基准测试中实现了 76.15% 的成功率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个机器人如何冲泡一杯咖啡。你录制了一段人类从头到尾完成该过程的视频,这段视频时长为 10 分钟。
旧方法(问题所在)
过去,在训练 AI 机器人时,研究人员会将那段 10 分钟视频的每一帧都输入给计算机。他们将每一秒都视为同等重要。
但请思考一下这段视频:
- 第 0–2 分钟: 人类缓慢地走向厨房台面。(几乎没发生什么)。
- 第 3 分钟: 他们拿起咖啡杯。(这是一个关键时刻!)。
- 第 4–8 分钟: 他们缓慢走向咖啡机并等待。(同样,大部分只是行走)。
- 第 9 分钟: 他们按下按钮,咖啡开始流出。(另一个关键时刻!)。
- 第 10 分钟: 他们走开。
该论文指出,这种“旧方法”效率低下。机器人花费 80% 的学习时间观看人类缓慢行走,而只有 20% 的时间用于观察实际棘手的部分(抓取、倾倒)。这就像为了准备数学考试而反复阅读同一个枯燥的章节,却只是匆匆瞥了一眼解题所需的实际公式。
新解决方案:FRAMESKIP(帧跳过)
作者开发了一种名为FRAMESKIP的工具。把它想象成一个超级智能的视频编辑器,它在机器人开始学习之前就能发挥作用。
FRAMESKIP 不会向机器人展示完整的 10 分钟视频,而是剪掉枯燥的部分,制作出一个“精彩集锦”。它将缓慢行走的部分压缩得非常短,但放大并重复重要的部分(例如手拿起杯子的动作),让机器人能更频繁地看到这些内容。
它如何知道该保留什么?
FRAMESKIP 利用四个简单的“线索”来决定哪些帧是重要的:
- 动作变化: 机器人的手是否突然快速移动?(保留该帧)。
- 视觉变化: 画面是否因物体移动而改变?(保留该帧)。
- 任务进度: 这是否是任务中通常容易出错的中段?(保留该帧)。
- 夹爪动作: 机器人的“手指”是否张开或闭合?(保留该帧)。
神奇之处
最酷的一点是,FRAMESKIP 并不改变机器人的“大脑”或其学习方式。它只是改变了机器人看到的数据内容。这就像给同一个学生提供更好的学习指南,而不是试图让学生变得更聪明。
结果
研究人员在三种不同的机器人模拟游戏中测试了这种方法。
- 结果: 当他们使用“精彩集锦”(仅保留原始帧的 20%)时,机器人完成任务的能力实际上比观看完整枯燥视频时更强。
- 得分: 采用新方法时,机器人的成功率约为76%,而旧方法仅为66%。
一句话总结
该论文指出:“我们不需要向机器人展示视频的每一秒来教导它们。如果我们跳过枯燥的部分,专注于机器人真正需要执行动作的时刻,机器人就能学得更快,表现也更好。”
这就像为了学会系鞋带而阅读整本百科全书,与仅仅观看一段 30 秒的系鞋带视频之间的区别。FRAMESKIP 帮助机器人在“百科全书”中找到那个"30 秒视频”。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。