← 最新论文
🤖 machine learning

Efficient Vision-Language-Action Management and Serving for Robot Factories

本文介绍了 Robion,这是一种用于边缘服务器上多机器人、多模型视觉-语言-动作(VLA)工作负载的新型服务与管理系统,它通过采用 GPU 内阶段解耦(intra-GPU stage disaggregation)和智能流量控制,在严格遵守毫秒级安全服务水平目标(SLO)的同时,最大化机器人负载。

原作者: Dionysios Adamopoulos, Nattapol Chanpaisit, Basel Fakhri, Christina Giannoula

发布于 2026-09-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Dionysios Adamopoulos, Nattapol Chanpaisit, Basel Fakhri, Christina Giannoula

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下这样一个工厂车间:机器不再仅仅遵循僵化的、预设的指令,而是能够观察世界,理解自然语言给出的指令,并决定如何移动自己的手臂来抓取零件或组装组件。这就是物理人工智能(physical artificial intelligence)所承诺的前景,在这个领域中,机器人配备了“视觉-语言-动作”模型。这些系统充当机器人的大脑,接收摄像头的图像和像“拿起红色的盒子”这样的文本提示,然后计算出完成任务所需的精确物理动作。为了让这些机器人安全且高效地工作,它们必须在眨眼之间做出反应。如果大脑思考时间过长,机器人可能会猛烈甩动手臂、掉落物体,甚至导致整条装配线停工,从而造成昂贵的延误或安全隐患。

挑战在于,那些足以运行这些思考模型的计算机过于沉重、昂贵且耗电,无法直接绑在机器人身上。因此,工程师们提出将机器人的思维发送到附近的本地服务器——一种数字大脑中心——由其承担繁重的计算任务,并将答案传回。然而,这种设置产生了一个新问题:如何管理一个必须同时为数十个机器人提供服务的单一服务器,确保每一个请求都能得到足够快速的响应,以保持工厂顺畅运行?一种名为 Robion 的新系统被设计出来,正是为了解决这个难题,它允许单个服务器在不间断的情况下同时处理许多不同的机器人任务。

Robion 背后的研究人员发现,这些机器人大脑的工作方式与用于聊天机器人的大型语言模型或用于艺术创作的大型图像生成器有着本质的区别。虽然那些系统的运行时间通常为数百毫秒甚至数秒,但机器人的思考过程仅发生在毫秒之间。这是一个两步走的过程:首先,系统观察图像并阅读指令以理解现状;其次,它计算出执行动作所需的具体物理运动。由于这两个步骤速度极快且需求不同——一个需要重度计算,而另一个需要快速的内存访问——试图在服务器上将它们作为一个单一、连续的流水线来运行是低效的。这就像是试图同时跑一场马拉松和一场短跑;缓慢、沉重的跑者会拖慢轻快、灵敏的跑者。

为了解决这个问题,团队构建了 Robion,将这两个步骤拆分开,并在同一块计算机芯片上并排运行,但采用了精心控制的方式。他们在服务器的处理器上创建了两条不同的交通车道。一条车道处理沉重的思考,另一条车道处理快速的运动计算。至关重要的是,他们设计了一个交通控制器,确保重型车道不会完全阻塞轻型车道。他们通过为快速车道保留特定数量的计算能力来实现这一点,保证即使在进行重度思考时,它也始终有空间运行。这使得服务器可以同时处理多个机器人的请求,将一个机器人的思考过程与另一个机器人的运动计算过程进行重叠。

此外,研究人员意识到,单个服务器可以处理许多不同类型的机器人,每种机器人都有其特定的工作和特定版本的“大脑”。有些机器人可能在打包箱子,而另一些则在组装汽车零件。Robion 允许这些不同的机器人大脑生活在同一个服务器上,共享相同的计算车道。该系统充当一个智能调度员,不断检查哪个机器人最接近错过其安全截止时间。如果一个机器人即将耗尽完成任务的时间,系统会立即优先处理其请求,确保最紧急的任务得到完成。这防止了因为某个机器人等待答案过久而导致整个工厂陷入停滞。

团队在一个模拟工厂环境中测试了这个系统,该环境配备了多达四块强大的图形显卡(即驱动这些 AI 模型的引擎)。他们将 Robion 与现有方法进行了对比,现有方法要么将机器人大脑作为一个单一、不间断的链条运行,要么将步骤拆分到不同的计算机上。结果显示,Robion 可以支持比其他方法多得多的机器人,同时仍能满足严格的时间要求。在一次大规模测试中,运行 Robion 的单个服务器成功管理了八种不同的机器人模型,同时为多达 64 个机器人提供服务,成功率高达 98%。这意味着对于几乎每一个请求,机器人都能及时收到答案,从而安全地继续移动。

研究还探讨了是将机器人大脑的不同部分放在不同的计算机上更好,还是将它们放在一起更好。他们发现,将思考阶段和运动阶段拆分到不同的计算机上实际上会让事情变得更慢、效率更低,因为数据必须来回传输,浪费了宝贵的时间。通过将所有内容保留在一个强大的服务器上并仔细管理内部交通,Robically 实现了更好的性能。研究人员还考察了成本,指出使用单个强大的服务器来运行许多机器人,比尝试在每个机器人上都配备昂贵的高性能计算机要便宜得多。这种方法可以让大型公司的先进自主工厂成为现实,允许他们部署能够高效协作的智能机器人集群,而不会造成计算资源的过载。

最终,Robion 表明,运行一个智能机器人工厂的关键不仅在于拥有强大的计算机,还在于拥有一个能够以极高精度管理这些计算机的系统。通过理解机器人决策过程那种分秒必争的特性,并设计出一个尊重这些紧迫截止时间的服务器,研究人员为扩展物理人工智能规模创造了一个蓝图。该系统确保了随着工厂变得更大、更复杂,机器人仍能实时进行观察、思考和行动,保持生产线的平稳运行和安全。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →