想象一下,你正试图教一个超级智能机器人完成一百种不同的工作,比如叠碗、采摘水果或盖章。你拥有一个巨大的视频演示库,展示了人类是如何完成这些任务的。
问题在于?这个库非常庞大,而且并非每个视频都有帮助。有些视频展示了完美的动作,而有些则展示了笨拙的错误或无关的行为。如果你只是把所有视频都喂给机器人,它会感到困惑、浪费时间,甚至可能学坏。但如果你试图通过观看所有视频来手动挑选出“最好”的视频,那将耗费大量时间。
这就是 ATHENA 发挥作用的地方。把 ATHENA 想象成一个超级聪明、极速运转的图书管理员,它能帮助你为机器人策划出一份完美的训练库。
以下是它的工作原理,通过简单的概念进行拆解:
1. 问题所在:数据太多,速度太慢
在过去,试图弄清楚哪个特定的视频对机器人的学习帮助最大,就像是在沙滩上数每一粒沙子,只为了找到那颗能造出最好沙堡的沙子一样。
- 规模问题: 现代机器人大脑(称为 VLA 模型)非常庞大,拥有数十亿个“神经元”(参数)。
- 瓶颈问题: 传统方法需要反复重新训练机器人的大脑,每次剔除一个视频,观察机器人是变得更好了还是更差了。对于拥有数十亿参数的模型来说,这在计算上是不可能的——这会耗费数千年时间。
- 多任务混乱: 如果你有 50 个不同的任务,一个简单的“挑选最佳视频”的方法往往会选出对某一个任务(如叠碗)非常有帮助、但对其他任务却毫无用处甚至有害的视频。这就像雇佣了一位擅长做寿司但完全不会烤面包的厨师,然后试图同时教他这两项技能。
2. 解决方案:ATHENA 的两大超能力
ATHENA 通过两个主要的技巧解决了这些问题:
技巧 A:“捷径”(加速计算)
与其通过对整个数十亿参数的大脑进行繁重的数学运算来计算每一个视频的影响,ATHENA 使用了一个聪明的数学捷径。
- 类比: 想象你要测量一艘巨轮的重量。普通方法需要逐一称量每一块木板的重量。然而,ATHENA 意识到这艘船是按照特定的、重复的模式建造的(比如一堆相同的砖块)。它不需要称量每一块木板,而是称量几块具有代表性的砖块,然后使用公式瞬间得出总重量。
- 结果: 这个捷径使计算速度提高了 313 倍。曾经需要数周计算机时间的工作,现在只需几个小时。
技巧 B:“公正的评委”(多任务交互)
一旦 ATHENA 可以快速计算分数,它就需要决定保留哪些视频。
- 类比: 想象一场有 50 个不同类别(唱歌、跳舞、杂耍等)的才艺表演。一个糟糕的评委可能会只挑选那些声音最大的歌手,从而忽略了杂技演员。ATHENA 则扮演着公正制片人的角色。它会对每个视频提出两个问题:
- “这个视频对它所属的特定任务有多大帮助?”(局部影响)
- “这个视频对其他 49 个任务有多大帮助?”(全局影响)
- 结果: 它创建了一个平衡的库,让机器人能学到各种各样的技能,确保机器人不会成为某一领域的专家却在其他领域表现糟糕。
3. 成果:更少的数据,更好的性能
研究人员通过两种方式测试了 ATHENA:
在模拟器中(电子游戏): 他们使用了一个包含 50 个不同任务和 2,500 小时视频数据的机器人模拟器。
- 结论: ATHENA 能够仅使用 50% 的数据(一半的视频)进行训练,却能达到与使用 100% 数据相同(甚至更好)的结果。
- 比喻: 这就像一名学生只读了半本教科书,但拿到的成绩比读完整本书的学生还要高,因为他读的是正确的页面。
在真实机器人身上(物理世界): 他们在六个真实的现实任务(如采摘水果或擦拭黑板)中使用真实的机械臂进行了测试。
- 结论: 使用仅 66.7% 的数据,ATHENA 帮助真实机器人在成功率上超过了使用全部数据或单独针对每个任务进行训练的情况。
- 比喻: 这就像一位教练从训练营中剔除了枯燥、重复的练习,只留下高强度的核心训练,从而让团队在实际比赛中表现得更好。
总结
ATHENA 是一个帮助机器人开发者停止在糟糕数据上浪费时间和金钱的工具。通过使用数学捷径来加速过程,并使用“公正评委”系统来平衡不同的任务,它让机器人能够使用更小、更高质量的演示数据来更快、更好地学习。
核心要点: 让机器人变得更聪明并不需要更多的数据;你需要的是更好的数据,而 ATHENA 正是寻找这些数据的工具。
技术摘要:ATHENA
问题陈述
在机器人模仿学习领域,视觉-语言-动作(VLA)模型在经过大规模演示数据训练后展现出了巨大的潜力。然而,这些模型的性能高度依赖于数据质量,而非仅仅是规模。盲目地通过增加演示数据规模来进行微调,往往会产生高昂的成本,却只能获得有限的性能提升,甚至导致性能下降。
本研究解决的核心挑战是如何为十亿参数级、多任务 VLA 模型高效地筛选高质量的演示子集。现有的数据价值评估方法在应用于此类规模时面临两个主要障碍:
- 计算可扩展性: 传统的影响函数(influence function)方法需要进行逐样本梯度计算($O(DP)$)和稠密海森矩阵(Hdessian)求逆(O(NP2+P3)),其中 D 是参数数量,P 是投影维度,N 是样本数量。对于十亿参数级的模型,这些计算成本是无法承受的。
- 多任务不平衡: 将单任务影响归因简单扩展到多任务设置中,往往会导致贪婪选择,即倾向于具有更强梯度信号的任务,从而导致在 50 多个共同训练的任务中出现数据筛选失衡。
方法论:ATHENA 框架
作者提出了 ATHENA(加速多任务异构影响函数),该框架旨在将影响函数计算扩展到十亿参数级的 VLA 模型,同时确保多任务筛选的平衡性。
1. 加速影响估计
ATHENA 通过两项关键技术创新解决了计算瓶颈:
- 克罗内克压缩梯度特征化(Kronecker Compressed Gradient Featurization): ATHENA 不再直接生成完整的参数梯度($O(DP)),而是利用线性层梯度的克罗内克结构。通过在形成外积之前分别对激活因子(x)和反向传播误差因子(\delta)进行投影,该框架将每层的投影成本从O(DP)降低到O(\sqrt{DP})$。这避免了存储十亿参数模型完整梯度带来的内存瓶颈。
- 秩-r 随机截断近似(Rank-r Random Truncated Approximation, RTA): 为了避免对稠密投影海森矩阵(G⊤G+λI)进行求逆所带来的 O(NP2+P3) 成本,ATHENA 使用领先的随机谱分量(G≈UrΣrVr⊤)来近似压缩后的梯度矩阵 G。这使得主导的数据相关成本从 O(NP2) 降低到 $O(NPr),其中r \ll P$。
2. 多任务影响交互(MII)
为了防止异构任务之间的筛选失衡,ATHENA 引入了**多任务影响交互(Multitask Influence Interaction)**机制。它将一个演示 i(属于任务 c(i))的影响分解为两个部分:
- 局部影响(Ψ^π-infc(i)): 该演示对其自身任务评估展开(rollouts)的影响。
- 跨任务影响(Ψ^π-infall-c(i)): 该演示对其他任务展开的影响。
最终的筛选得分(fiMII)被公式化为这两个组件所衍生的归一化效用的乘积。这确保了所选子集在保留局部关键样本的同时,兼顾了跨任务的交互作用,从而平衡了所有 50 个任务的投资回报率(ROI)。
关键结果
作者在 RoboTwin 2.0 仿真基准(50 个任务,9.34 小时数据)和 六个真实机器人 ALOHA 任务(6.90 小时数据)上对 ATHENA 进行了评估。
- 计算效率: 与未优化的基线相比,ATHENA 在影响函数计算方面实现了 313.4 倍的加速,将 50 任务、56 万步场景下的时间从约 8,054 GPU 小时缩短至约 25.7 GPU 小时。
- 仿真性能(RoboTwin 2.0): 仅使用 50% 的演示数据,ATHENA 在清洁评估下达到了与全数据联合微调相当的性能(成功率 43.36% vs. 43.42%),并在随机评估下超越了后者(17.30% vs. 15.44%)。相比全数据训练,这在 50 个任务中实现了累计 45.0 个百分点的提升。
- 真实机器人性能: 在六个真实机器人任务上,ATHENA 仅使用 66.7% 的数据就达到了 68.0% 的平均成功率。这优于全数据联合微调基线(60.0%),并显著超过了单任务微调基线(46.7%)。
- 可迁移性: 研究表明,在 π0 模型上生成的 ATHENA 筛选子集能显著提升 π0.5 模型的性能,这表明高影响力的演示数据可以在不同的 VLA 模型变体之间泛化。
意义与主张
本文声称 ATHENA 为十亿参数级多任务 VLA 微调中的数据筛选提供了一种原则性的、可扩展的解决方案。其重要性在于:
- 可扩展性: 它是第一个通过利用克罗内克结构和随机截断,能够处理十亿参数模型的影响函数框架,克服了以往高昂的计算成本。
- 多任务平衡: 它引入了一种新的归因规则,可以平衡不同任务间的数据筛选,避免了以往方法的贪婪选择缺陷。
- 高投资回报率(ROI): 该框架证明,高质量的数据筛选可以产生与全数据训练相当甚至更好的性能,同时使用显著更少的演示数据,从而降低了大规模机器人策略微调相关的计算和存储成本。
作者指出,将这些方法扩展到预训练数据筛选以及使用真实机器人展开进行影响估计的高昂成本,是目前存在的局限性,并将这些作为未来的研究方向。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。