想象一下你正在教一个机器人玩抛球杂耍。在机器人领域,人们正致力于构建“基础模型”——即那些通过观察人类来学习几乎所有技能的、超级智能的大型AI大脑。这些大脑就像巨大的知识图书馆,通过阅读书籍(文本)和观察图片(视觉)来理解世界。为了让这些大脑能够做出动作,工程师们使用了一种叫做“动作分块”(action chunking)的技巧。与其告诉机器人“把手移动到这里,然后移动到那里,再移动到那里”这种极其微小的步骤,不如让AI一次性预测出一整块未来的动作序列,就像厨师在开始烹饪前先写出一份完整的食谱一样。这使得机器人的动作更加流畅且连贯。
然而,这里有一个问题。因为AI规模庞大且复杂,编写出这样一份完整的食谱需要很长时间。当机器人执行完食谱的前几个动作时,周围的世界可能已经发生了变化——一个球可能滚走了,或者一个人碰到了它的手臂。由于机器人在“开环”(open-loop)状态下执行旧的食谱(即不观察当前发生的情况),它无法做出足够快的反应。这就像是在开车时戴着一副只能看到十秒钟前路况的眼罩。如果你希望机器人具有真正的反应能力,你需要让它观察“现在”的路况,但那个庞大的大脑更新食谱的速度太慢了。
这就是名为 πR2(读作“Pi-R-Squared”)的新想法出现的地方。卡内基梅隆大学的研究人员意识到,虽然机器人的“眼睛”和“大脑”(视觉和语言部分)反应迟缓且沉重,但它的“身体感觉”(本体感受——即感知关节位置、运动速度以及受力程度的能力)却是极其敏捷的。他们构建了一个系统,将机器人的注意力分为两个通道:一个用于处理宏观景象(物体看起来如何)的缓慢且沉重的通道,以及一个用于处理身体即时感受的极速通道。
把这想象成一名飞行员驾驶飞机。飞行员通过观察地图和天气报告(缓慢的视觉部分)来决定大致方向,但他们会不断地感受操纵杆和风在手中的触感(快速的本体感受部分),以进行细微且瞬时的调整。πR2 让机器人也能做到这一点。它保留了用于总体计划的缓慢、宏大的食谱,但每当机器人移动一寸肌肉时,都会利用新鲜的数据来更新即时的“方向盘”动作。
论文显示,这种方法是一个游戏规则的改变者。通过一种巧妙的调度技巧,将机器人的当前动作视为“进行中的工作”而非“最终成品”,πR2 更新计划的速度比以往的方法快了大约 4 倍。在测试中,即使是在运行一个庞大且缓慢的AI模型时,这种方法也能让机器人在每 40 毫秒(即每秒 25 次)都能根据新信息做出反应。
结果令人印象深刻。在计算机模拟中,这种新方法将成功率提高了多达 23%。但真正的魔力发生在现实世界中。当在配备灵巧手的真实机器人手臂上进行测试时,πR2 比现有的最佳方法提升了多达 30%。它可以接住掉落的书本、扶起倒下的盒子,并整理好一堆书本而不使其掉落,这一切都是因为它能感受到世界的变化并即时调整抓握力度,而不是盲目地遵循旧计划。研究人员发现,当其他机器人因为反应太慢而压坏书本时,πR2 会在感觉到书本滑动的瞬间温柔地调整抓握。这表明,对于机器人要真正掌握动态的现实世界任务,它们不仅需要更聪明,还需要更快地倾听自己身体的声音。
技术摘要:πR2:反应式实时流策略
问题陈述
近期机器人基础模型的进展确立了一种标准架构,即结合大型预训练骨干网络(如视觉语言模型或 VLM)、表达能力丰富的多模态策略头(扩散或流匹配)以及动作分块(action chunking)。虽然这种范式能够实现可扩展的模仿学习,但在应用于动态闭环控制时面临两个关键限制:
- 反应性降低: 动作分块是以开环方式执行的。一旦预测出动作块,机器人在执行过程中无法对到达的感官输入做出反应,直到下一个动作块生成。
- 高延迟: 感知到动作的流水线涉及沉重的计算量(大型骨干网络推理 + 多次去噪步骤)。这种延迟阻止了频繁的重规划,迫使策略依赖于“陈旧”的感官观测。因此,机器人根据过时的状态来提交动作,使其不适用于需要快速、平滑且具反应性的任务(例如,接触丰富的操控任务)。
仅仅通过减小分块大小来提高反应性是不可行的,因为骨干网络和多次去噪迭代的计算成本仍然过高,无法满足高频控制循环的要求。
方法论
作者提出了 πR2,这是一个修改现有流匹配策略的框架,旨在不丢弃大型骨干网络或多动作预测的情况下,实现实时、闭环的反应性。该方法依赖于两个核心的架构与调度创新:
1. 本体感受反应式扩散强迫(Proprioception-Reactive Diffusion Forcing)
作者发现输入处理成本存在不对称性:本体感受信号(关节位置、速度、力矩)的处理速度比视觉或语言数据快几个数量级。
- 双通道调节: 策略将调节信息解耦为两个通道:
- 快速通道: 本体感受,在每次控制滴答(例如每 40 ms)时更新。
- 慢速通道: 来自 VLM 骨干网络的视觉和语言特征,异步更新。
- 异步处理: 动作头在每一次去噪步骤中都基于新鲜的本体感受进行调节,同时容忍视觉语言特征的有限陈旧性。在训练期间,慢速通道会被人为地延迟一个随机时间 dvlm,以教会模型如何处理陈旧的视觉输入。在推理阶段,视觉语言特征在后台线程中处理,允许动作头利用缓存的特征和新鲜的本体感受立即运行。
2. 延迟自适应流调度(Latency-Adaptive Flow Schedule)
为了处理由硬件、网络延迟或计算负载引起的变动推理延迟 (d),πR2 引入了一个由测得延迟 d 参数化的阶梯式噪声调度。
- 三区域调度: 对于目标延迟 d,长度为 H 的动作块被分为:
- 前端 (0≤p<d): “在途”动作,这些动作已经在执行中。它们被视为内补(inpainting)调节条件(被钳制为干净状态)且不再重新预测。
- 中间层 (d≤p<H−d): 从干净到噪声的线性渐变。模型在此处预测新的动作。
- 尾部 (H−d≤p<H): 添加到缓冲区的纯噪声槽位,用于未来的预测。
- 单步推理: 不同于标准流匹配需要 K 个去噪步骤来预测整个动作块,πR2 使用单步去噪调用来发射 d 个新的干净动作。随后缓冲区向前滑动,并追加新鲜的噪声槽位。
- 训练策略: 模型通过采样随机延迟 d 并应用相应的阶梯调度进行训练。掩码会排除“前端”(在途)动作的损失。这使得单个模型能够在部署时适应不同的推理延迟。
核心贡献
- 反应式实时推理: πR2 使流策略能够以比基础策略快约 4 倍 的速度进行闭环重规划(在 A5000 GPU 上使用类似 GR00T-N1.7 的大型 VLA 时,实现了 25 Hz 的频率),并基于新鲜的本体感受观测进行操作(每 40 ms 一次)。
- 架构极简主义: 该方法对现有架构的修改极小。可以通过微调预训练策略(例如 VLA)来应用该方法,无需重新训练沉重的骨干网络,只需改变调节机制和噪声调度即可。
- 延迟自适应: 提出的噪声调度允许单个模型无缝处理变化的推理延迟,即使在延迟波动时也能保持平滑执行。
实验结果
作者在模拟和真实世界设置中使用 GR00T-N1.7 模型在 xArm6 + XHand 平台上对 πR2 进行了评估。
模拟环境(方块重定向):
- 在无推理延迟的情况下,πR2 的表现与具有较小执行时界(h=1,2)的标准流策略相当,同时摊销了去噪成本。
- 在现实的延迟约束下,采用异步处理的 πR2 显著优于基准方案(Naive Async, Train-Time RTC)。随着延迟增加,πR2 保持了较高的成功率,而基准方案性能大幅下降。这证实了即便视觉信息陈旧,最新的本体感受对于反应性任务也至关重要。
真实世界操控:
- 任务包括接触丰富的场景:“不要洒出”、“整理书籍”、“插入盒子”和“接住书本”。
- 性能: 与最强的基准方案(Train-Time RTC)相比,πR2 在模拟中成功率提升高达 23%,在真实世界中提升达 30%。
- 定性分析: 在“整理书籍”任务中,πR2 能够根据实时的本体感受反馈调节抓握力(在约 50 N 时停止),而基准方案(Train-Time RTC)对接触反应过慢,过度抓握(约 120 N)并压坏了书本。πR2 展示了卓越的从失败中恢复以及执行平滑、反应性运动的能力。
意义与主张
论文声称 πR2 成功弥合了大规模基础模型的表达能力与动态操控所需的反应性之间的差距。通过将缓慢的语义骨干网络与快速控制循环解耦,并将流调度与延迟相适应,πR2 使机器人能够:
- 在一个动作块内对感官输入(特别是本体感受)做出反应。
- 保留多动作预测和大型预训练骨干网络的优势。
- 实现此前在复杂 VLA 架构中难以实现的实时闭环控制频率(25 Hz)。
作者强调,这种方法不需要从头开始训练,而是对现有策略进行原则性的微调,这为在当前的机器人基础模型上部署反应式行为提供了一个实用的解决方案。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。