← 最新论文
💻 computer science

Jetson-PI: Towards Onboard Real-Time Robot Control via Foresight-Aligned Asynchronous Inference

Jetson-PI 是一个用于在 Jetson Orin 等低功耗车载设备上部署视觉-语言-动作(Vision-Language-Action)模型的创新框架,它通过结合一个用于解决感知-执行失配的前瞻对齐未来修正模块,以及通过基于置信度的调度和系统级优化来最小化反应时间和延迟,从而实现了实时控制。

原作者: Zebin Yang, Qi Wang, Yunhe Wang, Xiurui Guo, Bo Yu, Shaoshan Liu, Jiafeng Xu, Hao Dong, Meng Li

发布于 2026-07-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Zebin Yang, Qi Wang, Yunhe Wang, Xiurui Guo, Bo Yu, Shaoshan Liu, Jiafeng Xu, Hao Dong, Meng Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人折衣服或拿起碗。你给了它一个大脑(一个超级智能的 AI 模型),它通过观察一张图片和一条指令,比如“拿起黑色的碗”,然后告诉机器人的手臂该做什么。这被称为视觉-语言-动作(Vision-Language-Action,简称 VLA)模型。

问题在于?这些大脑既庞大又贪婪。如果你尝试在机器人自带的计算设备上(比如 Jetson Orin,它虽然强大但相对于台式机来说非常微小)运行它们,机器人就会陷入“思考模式”。它计算下一步动作所需的时间太长,以至于当机器人真正开始移动时,世界已经发生了变化。这就像是在戴着一副只能看到一秒钟前球在哪里、而不是现在球在哪里的眼镜时去接球。机器人会失手。

核心理念:“预见性”与“异步”
这篇论文的作者们提出了一个名为 Jetson-PI 的巧妙方法,让这些机器人无需依赖庞大且耗电的超级计算机,就能思考得更快、行动得更聪明。

他们通过以下方式解决了两个主要的痛头:

1. “时空旅行”修复法(解决对齐问题)

问题: 在旧的方法中,机器人观察一张图片,思考很长时间(假设为 1.4 秒),然后行动。但在 1.4 秒内,机器人可能已经撞到了某个东西,或者物体已经发生了位移。机器人是在根据“过时的消息”进行行动。

解决方案: Jetson-PI 没有仅仅是等待,而是使用了“预见性对齐”(Foresight-Aligned)的小技巧。想象一下,机器人拥有一个微型且超快速的水晶球(一个轻量级的“未来修正模块”)。

  • 机器人承诺执行一个动作(比如“伸手去拿碗”)。
  • 水晶球能瞬间预测出该动作完成之后世界看起来是什么样子的。
  • 机器人随后利用这个“未来视图”来规划下一个动作。

这就像一位棋手,不仅在看当前的棋局,还能瞬间构思出对手走完下一步后棋局的变化,从而完美地规划自己的下一步。这防止了机器人根据过时信息进行行动。

2. “智能跳过”修复法(解决反应迟钝问题)

问题: 即便有了水晶球,机器人仍需偶尔检查现实世界。但检查世界是很慢的,因为“大脑袋”(VLM)非常沉重。如果每次都检查世界,机器人的动作会变得太慢。

解决方案: 作者引入了一个“基于置信度的调度器”(Confidence-Based Scheduler)。

  • 水晶球(未来模块)也有一个“置信度计”。它会说:“我有 90% 的把握知道接下来会发生什么!”
  • 如果置信度很高,机器人就会跳过沉重的“大脑检查”,直接使用水晶球来继续移动。这就像在熟悉的路上开车,你不需要每秒钟都看一次 GPS。
  • 如果置信度下降(例如机器人正在处理一个棘手的物体),调度器会说:“好,停下!让我们用大脑袋来确保安全。”

这意味着机器人只在绝对必要时才进行繁重的计算,从而使其反应更加敏捷。

3. “系统升级”(加速引擎)

作者还意识到机器人运行的软件效率不高。他们把机器人的计算机比作一个繁忙的厨房:

  • 不再重建烤箱: 他们不再每次都重新构建烹饪指令(计算图),而是构建一次并重复使用。
  • 不再走动去冰箱: 他们将所有食材(数据)都放在了计数台上(GPU 显存中),这样厨师就不必在计数台和冰箱(CPU 内存)之间来回走动。
  • 展开步骤: 他们将许多细小的步骤合并成一个流畅的大动作。

结果:效果如何?

作者在模拟环境和真实机器人上进行了测试。

  • 速度: 在 Jetson Orin 上,他们的方法使机器人的控制频率比使用标准 PyTorch 快了 8.66 倍,比使用名为 vla.cpp 的工具快了 5.41 倍
  • 成功率: 在一项名为 LIBERO(一个机器人任务基准测试)的测试中,他们的机器人比之前的顶尖方法 VLASH 的成功率高出了 14.8%
  • 电池: 他们展示了使用强大的桌面显卡(RTX 4090)会导致机器人的电池消耗速度比使用自带的 Jetson Orin 快 6.0 倍。Jetson-PI 让机器人在自带电池下运行的时间更长。

他们明确指出哪些方法行不通
作者测试了一些想法并排除了它们:

  • 并行处理: 他们尝试同时运行“大脑袋”和“动作专家”以节省时间。他们发现这在小型嵌入式计算机上会失败,因为它们都在争夺有限的数据带宽,导致整体速度变慢。这只适用于巨大的桌面级计算机。
  • 仅预测机器人状态: 之前的方法试图预测机器人手臂在未来的位置。作者发现这还不够,因为它没有考虑到如何随环境(桌子、物体)的变化而变化。你需要预测的是环境,而不只是机器人本身。

他们的确定程度如何?
论文对所测量的数字非常有信心。他们在 LIBERO 基准测试上进行了广泛的模拟,并在实验室环境下使用真实机器人(如 X2-W)进行了测试。他们测量了精确到毫秒的延迟和精确的成功率。他们明确表示,虽然他们的方法对于移动机器人来说是一个巨大的进步,但如果未来的模型变得更大,它仍然无法完全匹配大规模计算集群的原始力量。但对于一个需要靠自带电池活动的机器人来说?他们认为这是一个切实可行且有效的解决方案。

简而言之,Jetson-PI 教会了机器人如何“预见未来”以及在安全时“跳过繁重劳动”,从而让机器人无需背负一台超级计算机,也能实现快速且智能的移动。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →