想象一下,你正在试图教一个机器人完成一项特定的工作,比如倒一杯咖啡或拿起一个特定的物体。你拥有一个庞大的视频库,里面记录了成千上万个机器人在做各种各样的任务:有些是专家,有些很笨拙,有些在做完全不同的工作,还有些只是在漫无目的地游荡。
问题在于:你该如何挑选出“正确”的视频来展示给你的机器人,好让它学得又快又不产生困惑?
旧方法:凭“长相”瞎猜
传统上,研究人员试图通过观察视频并挑选那些与目标任务“看起来”相似的视频来解决这个问题。
- 类比: 想象你想学习如何烘焙巧克力蛋糕。你走进一家图书馆,抓取了每一本封面上有蛋糕图片的书。
- 缺陷: 你可能会不小心抓到一本关于“巧克力软糖”(错误的配方)、一本关于“给蛋糕绘画”(不是烘焙)的书,或者一本虽然有蛋糕图片但文字是你看不懂的语言的书。你选对了“长相”,但内容却毫无用处甚至有害。在机器人领域,这被称为“启发式选择(heuristic selection)”,它往往会导致机器人学到坏习惯。
新方法:DataMIL(“试吃员”)
论文作者引入了一种名为 DataMIL 的新方法。DataMIL 不再根据数据“看起来”如何来猜测,而是问一个简单的问题:“如果我用这段特定的数据来训练机器人,它真的会变得更擅长这项工作吗?”
他们使用了一个聪明的技巧,叫做 “数据模型(Datamodel)”。
- 类比: 想象你有一个超级快速、微型的“试吃员”机器人。你并不想为了测试每一种食谱是否可行而真的去烤出一个完整的蛋糕(训练真实的机器人)——那样太慢也太费钱了。
- 相反,你会询问试吃员:“根据我的经验,如果我们把这个特定的原料加入混合物中,蛋糕的味道会变好吗?”
- 这个试吃员(数据模型)无需你真正去烤蛋糕,就能预测结果。它通过观察数据如何影响性能的模式来学习预测成功,而不是仅仅观察数据本身。
工作原理分为三步
- 预测: 系统查看庞大库中的每一个视频。它使用其“试吃员”进行预测:“如果我们用这段视频来训练机器人,它会成功吗?”
- 选择: 它挑选出试吃员认为最有帮助的视频。至关重要的一点是,它还会丢弃那些看起来很有帮助、但实际上会误导机器人的视频(比如错误的蛋糕配方)。
- 训练: 机器人仅在这一份经过精心挑选的高质量视频列表上进行训练。
为什么这意义重大
论文在超过 60 种不同的任务上测试了该方法,涵盖了计算机模拟和现实世界中的真实机器人。
- 结果: 使用 DataMIL 筛选出的数据进行训练的机器人,其成功率远高于使用“所有数据”进行训练或使用旧有的“看长相”方法进行训练的机器人。
- 惊喜: 有时,教机器人如何使用“Franka”机械臂的最佳数据,竟然来自完全不同的机器人(如“Tiago”机械臂)的视频。旧方法会因为它们看起来不同而忽略它们。但 DataMIL 意识到,尽管它们看起来不同,但其中的运动“逻辑”是有帮助的。
“秘诀”(规避危险)
通常,要了解一段视频是否对机器人有帮助,你必须在现实世界中实际运行机器人来观察它是否成功。这既缓慢、昂贵,又具有危险性(机器人可能会损坏物品)。
- 创新点: DataMIL 使用了一个“代理指标(proxy metric)”。它不是通过在现实世界中运行机器人来检查成功与否,而是检查机器人的“数学模型”在小型测试集上预测正确动作的能力。这就像是检查学生的作业答案,而不是让他们参加期末考试来判断他们是否学到了知识。这使得他们能够安全、快速地进行选择,而无需冒着损坏现实设备的风险。
总结
DataMIL 就像一位聪明的图书管理员,他不仅仅是因为书的封面好看就去挑书。相反,这位图书管理员拥有一颗预知未来的“水晶球”,能精准预测哪些书能帮助学生通过特定的考试。通过使用这颗水晶球,机器人可以学得更快、犯错更少,甚至可以从那些看起来与它正在掌握的任务完全不同的数据中学习。
技术摘要:DataMIL —— 利用数据模型为机器人模仿学习选择数据
1. 问题陈述
机器人领域近期已转向使用大规模、多样化的数据集(如 Open-X Embodiment)来训练通用基础策略。虽然这些策略在各种任务中实现了强大的平均性能,但它们在单个特定任务上的表现往往不尽如人意,因此需要利用新获取的任务特定数据进行微调。
本研究解决的核心挑战是数据选择问题:即确定哪些先验数据集的子集,在与有限的任务特定演示相结合时,能够产生最优的专业化策略。
- 现有方法的局限性: 基于人类直觉(如语义相似性、视觉相似性或状态-动作接近度)的朴素选择往往会失败。这些启发式方法假设最“相似”的数据就是最“有用”的,却忽略了数据点对下游策略性能的实际影响。
- 优化障碍: 理想情况下,人们可以通过通过重新训练并评估生成的策略来穷举测试子集以进行选择。然而,在机器人领域,策略评估需要现实世界的展开(rollouts),这既耗时又危险,且对于大规模搜索而言在计算上是不可行的。
- 差距: 现有的数据归因框架(如 datamodels,即通过预测模型性能来预测训练数据)在自然语言处理和计算机视觉领域取得了成功,但由于现实世界策略评估的非微分性和高昂成本,尚未能直接应用于机器人领域。
2. 方法论:DataMIL
作者引入了 DataMIL(用于模仿学习的数据模型),这是一个将 datamodel 范式扩展到机器人领域的框架。DataMIL 以端到端的方式对数据选择进行推理,利用策略本身来识别提升性能的数据点,而不是依赖静态启发式方法。
2.1 核心框架
DataMIL 将策略学习算法视为一个“黑盒”,并训练一个估计器(即 datamodel)来预测基于特定数据子集训练出的策略性能。
- 目标: 寻找一个子集 D′⊂D,使得目标指标 M(A(D′)) 最大化,其中 A 是学习算法,M 是性能指标。
- Datamodel 公式化: DataMIL 不直接训练策略,而是学习一个函数 f^(D′)≈M(A(D′))。对于线性 datamodels,这简化为为每个数据点 zi 分配一个标量分数 τ(zi),预测的性能即为所选子集中分数的总和。
2.2 关键改进(针对机器人领域)
为了使 datamodels 在机器人领域具有可行性,作者引入了三个关键性的修改:
代理损失函数(避免展开):
现实世界的展开是非微分且昂贵的。DataMIL 使用一个代理指标 M~ 来替代真实的成功率指标,该指标定义为在留出的目标演示集上的负行为克隆(BC)损失:
M~(π,Dtarget)=∣Dtarget∣1(s,a)∈Dtarget∑−LBC(π(s),a)
该指标是完全可微的,且不需要环境交互,从而能够使用基于梯度的估计方法。
Datamodel 估计器:
论文采用了两种方法来估计影响分数 τ(zi):
- 回归估计器(Regression Estimator): 采样随机的数据子集,训练策略,评估代理指标,并拟合一个线性模型来根据数据的存在情况预测性能。这种方法很准确,但计算量巨大。
- 基于元梯度(Metagradient)的估计器: 使用影响函数(influence functions)和元梯度来计算目标指标相对于数据权重的导数。这种方法对于大型模型(如 Octo)更高效,并避免了为每个子集都重新训练策略的需求。
- 聚类与分布偏移缓解:
- 聚类(Clustering): 为了减少影响估计中的噪声,将单个状态-动作对分组为时间聚类(子轨迹或完整轨迹)。最优的聚类粒度取决于数据集的大小;较大的数据集(如 OXE)受益于轨迹级聚合。
- 分布偏移(Distribution Shift): 为了防止由于先验域与目标域之间的偏移导致估计偏差,在 datamodel 估计阶段包含一小部分目标任务数据,以使学习过程与目标域对齐。
2.3 训练流水线
一旦估计出影响分数后:
- 选择前 x% 的先验数据(具有最高正向影响)以构成 Dsel。
- 通过在目标数据 Dtarget 和所选数据 Dsel 上进行**协同训练(co-training)**来训练最终策略。在每一步中,以概率 α 从 Dtarget 中采样,以概率 1−α 从 Dsel 中采样。
3. 主要贡献
- 将 Datamodels 扩展至机器人领域: DataMIL 是第一个成功将 datamodels 应用于机器人模仿学习的框架,通过使用可微的代理损失克服了昂贵现实世界展开的障碍。
- 端到端性能感知: 不同于启发式方法(视觉、运动或状态相似性),DataMIL 直接优化对性能的影响,使其能够选择能提升性能的数据并丢弃会降低性能的数据,即使这些数据在视觉上看起来非常相似。
- 可扩展的估计器: 引入基于元梯度的估计器使得该框架能够扩展到大型复杂策略(如 Octo)和海量数据集(如 OXE),在这些场景下,基于回归的方法在计算上是难以实现的。
- 跨具身与多任务选择: 该方法展示了为先验数据集中不存在的任务和机器人具身选择有用数据的能力,并能策划支持多个下游目标的训练集。
4. 实验结果
作者在模拟和现实世界设置中对 DataMIL 进行了超过 60 项任务的验证:
- MetaWorld (50 个任务): DataMIL 比最先进的基准方法(Behavior Retrieval, Flow Retrieval, STRAP)实现了 10% 的性能提升。它成功过滤掉了来自自主探索数据的噪声及次优演示,而基于相似性的基准方法往往会检索到无关或低质量的数据。
- LIBERO (10 个任务): 使用 Octo Transformer 策略,DataMIL 在各种长程任务中始终优于基准方法。虽然视觉相似性基准在某些特定任务中表现良好,但 DataMIL 提供了最稳健的平均性能。
- Open-X Embodiment (OXE) (现实世界):
- Franka-Ball & Franka-Pouch: 与随机选择和启发式基准相比,DataMIL 选择的数据显著提高了成功率。
- Tiago-Sink: 在一个具有挑战性的跨具身设置中(从不包含 Tiago 数据的数据集中为 Tiago 机器人选择数据),DataMIL 成功地从其他机器人(如 RT-1, BC-Z)中识别出了共享任务“本质”(桌面操作)的相关演示,而基准方法则失败了。
- Droid-Multitask: DataMIL 策划了一个单一数据集,同时提升了三个不同任务的性能,其平均成功率优于基准方法。
定性发现:
- DataMIL 选择的是多样化的数据集组合,而不是过度依赖单一来源(不像基准方法通常会从一个数据集中检索 80% 以上的数据)。
- 它能有效区分有益数据和有害数据,即使它们在视觉上完全相同(例如:相同的状态但不同的动作分布),这是基于相似性检索常见的失效模式。
5. 重要性与主张
论文声称,端到端、性能感知的数据选择对于释放大型先验数据集在机器人领域的潜力至关重要。作者认为,虽然大型基础模型提供了强大的基础,但它们的专业化高度依赖于微调数据的质量。
- 对可扩展性的适度主张: 作者承认估计 datamodels 仍然具有较高的计算成本(是训练全量数据策略成本的数倍),尽管元梯度方法缓解了这一问题。他们指出,超参数调优(如聚类大小、选择比例)目前仍缺乏强有力的理论直觉。
- 范围: 本工作主要关注单任务专业化,而 Droid-Multitask 设置是向多任务策划迈出的初步尝试。
- 结论: DataMIL 证明了,从人类定义的启发式方法转向数据驱动、模型感知的选择,可以带来一致的成功率提升,特别是在复杂的、异构的以及传统的检索方法会失效的现实世界场景中。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。