← 最新论文
🤖 machine learning

πR2\pi\mathbf{R}^2: Reactive Real-time Flow Policies

本文介绍了 πR2\pi\mathbf{R}^2,这是一个通过将快速本体感受和慢速视觉调节进行解耦,并采用延迟自适应流调度,从而增强通用型动作分块流策略实时反应能力的框架,该框架在无需新的骨干网络架构的情况下,实现了高频闭环控制,并显著提高了动态操纵任务中的成功率。

原作者: Sungjae Park, Shubham Tulsiani

发布于 2026-07-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Sungjae Park, Shubham Tulsiani

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在教一个机器人玩抛球杂耍。在机器人领域,人们正致力于构建“基础模型”——即那些通过观察人类来学习几乎所有技能的、超级智能的大型AI大脑。这些大脑就像巨大的知识图书馆,通过阅读书籍(文本)和观察图片(视觉)来理解世界。为了让这些大脑能够做出动作,工程师们使用了一种叫做“动作分块”(action chunking)的技巧。与其告诉机器人“把手移动到这里,然后移动到那里,再移动到那里”这种极其微小的步骤,不如让AI一次性预测出一整块未来的动作序列,就像厨师在开始烹饪前先写出一份完整的食谱一样。这使得机器人的动作更加流畅且连贯。

然而,这里有一个问题。因为AI规模庞大且复杂,编写出这样一份完整的食谱需要很长时间。当机器人执行完食谱的前几个动作时,周围的世界可能已经发生了变化——一个球可能滚走了,或者一个人碰到了它的手臂。由于机器人在“开环”(open-loop)状态下执行旧的食谱(即不观察当前发生的情况),它无法做出足够快的反应。这就像是在开车时戴着一副只能看到十秒钟前路况的眼罩。如果你希望机器人具有真正的反应能力,你需要让它观察“现在”的路况,但那个庞大的大脑更新食谱的速度太慢了。

这就是名为 πR2(读作“Pi-R-Squared”)的新想法出现的地方。卡内基梅隆大学的研究人员意识到,虽然机器人的“眼睛”和“大脑”(视觉和语言部分)反应迟缓且沉重,但它的“身体感觉”(本体感受——即感知关节位置、运动速度以及受力程度的能力)却是极其敏捷的。他们构建了一个系统,将机器人的注意力分为两个通道:一个用于处理宏观景象(物体看起来如何)的缓慢且沉重的通道,以及一个用于处理身体即时感受的极速通道。

把这想象成一名飞行员驾驶飞机。飞行员通过观察地图和天气报告(缓慢的视觉部分)来决定大致方向,但他们会不断地感受操纵杆和风在手中的触感(快速的本体感受部分),以进行细微且瞬时的调整。πR2 让机器人也能做到这一点。它保留了用于总体计划的缓慢、宏大的食谱,但每当机器人移动一寸肌肉时,都会利用新鲜的数据来更新即时的“方向盘”动作。

论文显示,这种方法是一个游戏规则的改变者。通过一种巧妙的调度技巧,将机器人的当前动作视为“进行中的工作”而非“最终成品”,πR2 更新计划的速度比以往的方法快了大约 4 倍。在测试中,即使是在运行一个庞大且缓慢的AI模型时,这种方法也能让机器人在每 40 毫秒(即每秒 25 次)都能根据新信息做出反应。

结果令人印象深刻。在计算机模拟中,这种新方法将成功率提高了多达 23%。但真正的魔力发生在现实世界中。当在配备灵巧手的真实机器人手臂上进行测试时,πR2 比现有的最佳方法提升了多达 30%。它可以接住掉落的书本、扶起倒下的盒子,并整理好一堆书本而不使其掉落,这一切都是因为它能感受到世界的变化并即时调整抓握力度,而不是盲目地遵循旧计划。研究人员发现,当其他机器人因为反应太慢而压坏书本时,πR2 会在感觉到书本滑动的瞬间温柔地调整抓握。这表明,对于机器人要真正掌握动态的现实世界任务,它们不仅需要更聪明,还需要更快地倾听自己身体的声音。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →