Characterizing Vision-Language-Action Models across XPUs: Constraints and Acceleration for On-Robot Deployment
本文通过系统评估多样化加速器上的模型与硬件权衡、识别两阶段推理瓶颈,并提出 DP-Cache 和 V-AEFusion 技术,以在 GPU 和边缘 NPU 上实现显著加速并最小化性能损失,从而解决在资源受限机器人上部署视觉 - 语言 - 动作(VLA)模型所面临的挑战。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教机器人执行一项任务,比如拿起杯子或清理桌子。为此,机器人需要一个名为“视觉 - 语言 - 动作(VLA)模型”的“大脑”。这个大脑观察世界(视觉),理解你的指令(语言),并决定要做什么(动作)。
问题在于,这些大脑目前非常庞大且运行缓慢,尤其是在需要实时移动而不发生碰撞的机器人上。大多数研究人员一直在巨型、昂贵的超级计算机(如高端台式电脑)上测试这些大脑,但真正的机器人需要在更小、更便宜且由电池供电的设备上运行。
这篇论文就像是为这些机器人大脑提供的一本“机械师指南”和“性能调校手册”。以下是他们发现的内容以及他们如何解决问题,用简单的方式解释如下:
1. “尺寸合适”的汽车类比
研究人员提出了一个简单的问题:我们真的需要一级方程式赛车的引擎来开车去杂货店吗?
- 旧方法: 每个人都认为需要最强大、最昂贵的显卡(如 NVIDIA RTX 4090)来运行这些机器人大脑。这就像在小型货车里装上一台赛车引擎。它很快,但造价昂贵且耗油(能耗)巨大。
- 新发现: 他们建立了一个“排行榜”(记分板),在各种不同类型的硬件上测试这些机器人大脑,从强大的台式机到边缘设备中更小、更便宜的芯片。
- 结果: 他们发现,对于许多任务来说,“尺寸合适”的较小引擎(更便宜、低功耗的芯片)实际上更好。它购买成本更低,耗电量更少,并且速度快到足以完美完成任务。你并不总是需要最大、最昂贵的工具来完成工作。
2. “两步舞”问题
当他们仔细观察这些机器人大脑的工作原理时,发现了一个奇怪的节奏问题。大脑并非以稳定的速度工作,而是有两个截然不同的阶段,就像两步舞:
- 第一步:思考者(视觉 - 语言模型): 这部分查看摄像头并理解场景。它工作非常努力,几乎占用了计算机 100% 的算力。这就像马拉松运动员在冲刺。
- 第二步:规划者(动作专家): 这部分决定手臂具体如何移动。令人惊讶的是,这部分对计算机算力的利用非常“懒惰”。它主要等待数据从内存中获取,让强大的计算机处于闲置状态。这就像一名短跑运动员在比赛中途停下来系鞋带,占用了半场比赛的时间。
瓶颈: 由于这两个步骤是依次发生的(顺序执行),强大的计算机在“规划者”变慢时花费了大量时间等待。这浪费了能源并拖慢了整体速度。
3. 解决方案:“跳过步骤”与“并行停车”
为了解决这个问题,团队发明了两个巧妙的技巧,使机器人更快,而不会使其“变笨”(即不降低准确性)。
技巧 A:“跳过步骤”缓存(DP-Cache)
“规划者”部分通常通过采取 100 个微小步骤来计算出动作,就像反复素描直到完美为止。
- 解决方案: 研究人员注意到,在这个过程中,素描在一段时间内变化不大。因此,他们建立了一个缓存(内存捷径)。一旦素描稳定下来,机器人就重用之前的结果,而不是从头重新计算。
- 类比: 想象你在粉刷墙壁。与其混合新油漆并将其涂抹到每一平方英寸,你意识到中间部分已经干燥且完美,所以你就跳过粉刷它,直接移动到边缘。这使他们在某些较小芯片上的速度提升了高达6 倍。
技巧 B:“流水线”(V-AEFusion)
由于“思考者”和“规划者”通常依次工作,计算机处于闲置状态。
- 解决方案: 他们让这两部分同时工作,就像流水线一样。当“思考者”观察当前场景时,“规划者”开始利用上一个场景的数据处理下一个动作。因为机器人移动缓慢,“上一”个场景与“当前”场景几乎完全相同,所以“规划者”不会感到困惑。
- 类比: 想象一位厨师(思考者)在切菜,另一位厨师(规划者)在煎炸。与其等待厨师完成所有切菜工作后煎炸厨师才开始,不如让煎炸厨师在厨师继续切第二批菜时,开始煎炸第一批菜。这让厨房(计算机)保持忙碌并运行得更快。
4. 核心结论
该论文的结论是:
- 不要过度消费: 你并不总是需要最昂贵的计算机来运行机器人。如果选择合适的芯片,更小、更便宜的芯片也能同样出色地完成任务。
- 理解节奏: 机器人大脑有“忙碌”阶段和“等待”阶段。
- 智能捷径: 通过跳过冗余计算并让大脑的不同部分并行工作,你可以使机器人快 2 到 6 倍,而无需重新训练它们或花费更多资金。
他们甚至建立了一个公共网站(排行榜),任何人都可以查看哪种机器人大脑在哪个特定的计算机芯片上表现最佳,从而帮助工程师构建更好、更便宜的机器人。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。