✨ 要点🔬 技术摘要
长期以来,机器人一直难以像生物那样灵活地运动。虽然它们可以被编程为在工厂中遵循一套僵化的指令,但现实世界是混乱、不可预测且瞬息万变的。为了应对这一挑战,研究人员转向了一种被称为“视觉-语言-动作模型”(vision-language-action model)的类型的人工智能。这些是基于海量数据训练的庞大计算机程序,使它们能够通过摄像头理解所见之物,阅读文本指令,并决定如何移动机械臂。它们之所以强大,是因为它们见过许多关于世界运作方式的例子,就像一座庞大的经验图书馆。然而,这里有一个显著的问题:由于这些模型如此庞大且复杂,它们需要花费明显的时间来“思考”。在计算机处理图像并决定动作的短短一瞬间,物理世界已经发生了变化。如果机器人试图接住一个球或平衡一个物体,等到它实际做出动作时,它用来做决策的信息已经过时了,这往往导致行动失败。
斯坦福大学的一个研究小组开发出一种新方法,教导这些大型模型如何在实时环境中行动,即使它们的思考速度较慢。他们的方法被称为 Real-Time EXPO-FT,通过将机器人的决策过程拆分为两个截然不同的部分,解决了延迟问题。他们并没有强迫这个庞大且缓慢的模型去做出每一个细微的瞬间调整,而是让它负责完成规划大致路径的繁重任务,同时由一个更小、更快的计算机程序来处理即时的修正。想象一下指挥家带领管弦乐队:指挥家设定整体的节奏和旋律,但每位乐手必须立即调整自己的演奏以保持同步。在这个系统中,大型模型充当指挥家,根据它刚才看到的景象提出一系列动作方案。然后,一个轻量级的助手观察世界的当前状态,并对这些提议的动作进行快速、微小的编辑,以确保这些动作在机器人需要行动的精确时刻仍然是正确的。这使得机器人能够利用大型模型的深厚知识,而不受其缓慢思考速度的限制。
研究人员在两种完全不同的环境中测试了这种方法:一个物理模拟世界和一个真实的物理世界。在模拟中,他们向机器人提出了十个不同的动态任务,例如在盘子上平衡一个球、在避开防守队员的同时踢足球,以及接住一个移动的物体。他们将这种新方法与几种试图处理延迟的现有技术进行了对比。结果非常明确:新方法让机器人在几乎每一次尝试中都取得了成功,表现优于所有其他方法,包括那些甚至不需要处理延迟的方法。这是一个重要的发现,因为它表明,通过显式地教导系统去应对自身的迟缓性,机器人可以变得比那些理论上更快但适应性较差的系统更加可靠。
为了证明这在现实世界中有效,团队将机器人移至实验室环境,并给了它四个需要持续、快速反应的挑战性任务。这些任务包括:在旋转盘上保持乒乓球平衡、从旋转表面拿起一个方块、接住另一个机械臂传过来的物体,以及在防守队员移动时将球踢进球门。研究人员将训练时间限制在仅为机器人与环境交互的十分钟内,确保系统可以快速学习,而无需进行无休止的练习。在使用该方法之前,机器人在这些任务上的成功率相当低,平均约为 42%。在使用这种新的实时训练框架后,成功率跃升至 97%。机器人学会了适应物体的混乱运动和任务的时间限制,且在整个训练过程中无需任何人工干预。
该研究还探讨了系统在不同条件下的表现。当研究人员人为增加了机器人思考过程中的延迟时,新方法保持了其高水平的表现,而其他方法则随着延迟的增加而失败。同样,当移动物体的速度增加时,使用该新框架的机器人继续取得成功,而其他方法则难以跟上。这表明该系统不仅仅适用于特定的速度或延迟,而且足够鲁棒,能够处理动态环境中的不可预测性。研究人员指出,虽然他们的系统非常有效,但它仍然依赖于人类在任务结束后重置机器人,并且需要为每个任务定义特定的成功标准。然而,核心成就在于展示了大型、强大的 AI 模型可以被应用于实时环境,从而弥合了人工智能缓慢、深思熟虑的规划能力与物理世界快速、反应式需求之间的鸿沟。
技术摘要:Real-Time EXPO-FT
问题陈述 对大规模预训练视觉-语言-动作(VLA)模型进行强化学习(RL)微调,对于实现可靠的机器人部署具有重要意义。然而,这些模型的规模引入了显著的推理延迟。在动态的现实世界环境中,用于生成动作的观测值在执行发生时往往已经过时。这造成了分布偏移,即策略基于过时的状态信息进行动作决策,从而大幅降低了可靠性和性能。虽然先前的研究探索了异步执行(例如 Real-Time Chunking)来缓解延迟问题,但这些方法主要构建在模仿学习之上,缺乏超越训练分布进行演进的机制。此外,将标准的 RL 直接应用于延迟策略会无法捕捉到 RL 所能带来的完整可靠性增益,因为动作是基于之前的观测值预测的,这破坏了标准信用分配(credit assignment)所需的马尔可夫性质。
方法论:Real-Time EXPO-FT 本文提出了 Real-Time EXPO-FT 框架,该框架通过将缓慢、高表达力的动作生成与快速、反应式的动作编辑解耦,从而实现在实时约束下的 RL 微调。该方法基于 EXPO-FT (一种用于 VLA 微调的高样本效率 RL 系统)构建,并集成了 训练时实时分块(Training-Time Real-Time Chunking, RTC) 的概念。
其核心架构由在不同时间尺度上运行的三个组件组成:
异步 VLA 动作生成(慢速): 一个大型预训练 VLA 基准策略 (π V L A \pi_{VLA} π V L A ) 在后台异步运行。它根据观测值 s t s_t s t 和来自前一个分块的“已提交”动作前缀 (a t : t + d p r e v a^{prev}_{t:t+d} a t : t + d p r e v ),生成多个候选动作分块,以补偿推理延迟 d d d 。这一步利用流匹配(flow-matching)来采样多样化的候选样本。
快速同步编辑(快速): 一旦机器人到达执行时刻 t + d t+d t + d 并获取最新的观测值 s t + d s_{t+d} s t + d ,轻量级的编辑策略 (π e d i t \pi_{edit} π e d i t ) 会进行反应式决策。它接收由 VLA 生成的候选分块,并根据当前状态对它们进行编辑,以修正由于推理延迟导致的任何状态变化。
通过 Q 函数进行选择: 学习到的 Q 函数 (Q ϕ Q_\phi Q ϕ ) 在当前状态 s t + d s_{t+d} s t + d 下评估原始 VLA 候选动作和编辑后的候选动作。系统选择具有最高 Q 值的动作分块进行执行。
训练流程
VLA 微调: 使用改进的流匹配目标函数对基准 VLA 进行微调,该函数在训练期间模拟推理延迟。损失函数经过掩码处理,以排除前 d d d 个动作(延迟窗口),迫使模型学习在给定已提交前缀的条件下预测剩余动作。
编辑策略训练: 编辑策略的训练目标是最大化编辑后动作的 Q 值,从而有效地学习将基座策略的输出向动作空间中更高价值的区域移动。
评论家(Critic)训练: 评论家使用针对完整动作分块的时序差分学习进行训练。为了降低 Bellman 回退(Bellman backup)过程中的计算成本,该方法采用了受 FASTER 启发的噪声空间过滤机制。一个轻量级的评论家 (Q ψ d n Q^{dn}_\psi Q ψ d n ) 在完整解码前对候选噪声向量进行评分,使系统能够在噪声空间中过滤候选者,并在应用编辑之前仅对最佳候选者执行一次 VLA 解码。
核心贡献
实时 RL 框架: 本文引入了首个能够显式考虑推理延迟同时保持实时控制频率的 VLA 大模型 RL 微调框架。
解耦控制架构: 提出了一种将缓慢、高容量的行为生成(VLA)与快速、反应式状态修正(编辑策略)解耦的新颖架构,使系统既能利用 VLA 的先验知识,又能保持反应能力。
样本高效的适应: 通过结合 EXPO-FT 的样本效率与实时执行策略,该方法实现了对动态环境的快速适应,且仅需极少的在线数据。
实验结果 作者在 Kinetix 基准测试 (10 个模拟任务)和 四个动态现实世界任务 (机器人传球、球类平衡、足球踢球以及动态物体抓取)上对 Real-Time EXPO-FT 进行了评估。
模拟环境: 在 Kinetix 基准测试中,Real-Time EXPO-FT 在 10 个环境中全部表现最优 (优于延迟和非延迟方法)。尽管存在 4 步推理延迟,它仍显著优于延迟基准方法(DSRL、带或不带 RTC 的 EXPO-FT),甚至超过了非延迟的 RLPD 基准(平均成功率 81.4% vs 96.2%)。
现实世界: 在限制为 10 分钟在线机器人数据 的现实世界实验中,Real-Time EXPO-FT 将平均策略成功率从 42% (12.5/30) 提升至 97% (29/30) 。它在动态抓取和物体传递任务上达到了近乎完美的表现(30/30),并在球类平衡和足球踢球任务中达到了 28/30,大幅超越所有基准方法。
鲁棒性: 该方法在不同的推理延迟和环境速度下均表现出稳定的性能,而像 RTC 这样的基准方法在延迟增加时性能显著下降。
意义与主张 论文声称,Real-Time EXPO-FT 成功弥合了 RL 微调的高可靠性与动态现实世界操控所需的反应性之间的鸿沟。通过显式建模推理延迟并将动作生成与执行解耦,该方法允许将大型 VLA 模型部署在高速控制循环中,且不会牺牲性能。结果表明,在无需人工干预训练的情况下,实现对挑战性现实世界动态的快速、样本高效的适应是可能的,从而克服了由模型延迟引起的分布偏移。
局限性 作者承认,目前的实现依赖于人类操作员进行环境重置,这增加了操作负担。此外,奖励信号依赖于特定任务的成功分类器(基于规则或学习型),需要为每个新任务进行手动设计。论文指出,自动化重置以及探索替代的奖励公式仍是未来研究的开放性问题。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。