Deltoris: Enabling Real-time VLA Inference in Embodied AI via Bit-level Sparsity and Speculative Inference
Deltoris 是一个算法-硬件协同设计框架,它通过利用时间感知位稀疏性(temporal-aware bit-sparsity)、投机推理(speculative inference)以及定制的位串行脉动阵列加速器(bit-serial systolic accelerator),在边缘设备上实现了基于扩散的视觉-语言-动作模型的实时、高能效推理,并相比现有解决方案实现了显著的加速。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,一个机器人正试图学习如何玩接球游戏。为了做到这一点,它需要一个能够看到球、理解规则并决定如何精确移动手臂的“大脑”。在机器人领域,这个“大脑”通常被称为一种特殊的计算机程序,叫做视觉-语言-动作(Vision-Language-Action,简称 VLA)模型。把它想象成一个超级聪明的翻译官,将机器人所见所闻转化为物理动作。长期以来,这些机器人一直显得有些迟钝和笨拙,因为让它们运动所需的数学计算量极其庞大,就像背着一包砖头去跑马拉松一样吃力。
最近,科学家们发现了一种教机器人运动的新方法,叫做“扩散”(diffusion)。想象一下,机器人通过先在雾气弥漫的房间里蹒跚学步,然后一步步拨开迷雾,直到找到完美路径的过程来学习走路。这种方法让机器人的动作比以前更加流畅,并且能更好地应对新情况。然而,这里有一个问题:这种“拨开迷雾”的过程计算量太大,无法用于实时应用。机器人需要每秒做出 50 到 200 次决策才能保持平衡和安全,但这些新模型处理速度太慢,就像蜗牛试图在与猎豹的比赛中获胜一样。这正是研究人员试图解决的问题:我们如何让这些拥有超聪明、流畅动作的机器人,变得足够快,以跟上现实世界的节奏?
于是有了 Deltoris,一个旨在提高机器人大脑速度且不降低其智能的巧妙系统。研究人员意识到,机器人生活的世界并非一切都在瞬间发生剧变。如果机器人正在伸手去拿杯子,从一毫秒到下一毫秒,杯子在视野中的变化几乎是完全一样的。这就像看电影时,98% 的帧画面都是相同的;你不需要每次都重画整幅图像,只需要画出那微小的变化部分即可。
Deltoris 利用这一观察结果,通过一种称为时间感知位级稀疏性(temporal-aware bit-level sparsity)的技术来发挥优势。系统不再为每一次动作都重新计算整个数学问题,而是只计算当前时刻与上一时刻之间的“差异”。这就像发一条短信,只说“我的手向上移动了 2 英寸”,而不是每次移动时都重写一遍你的完整传记。这跳过了大量的无用功,将计算量减少了 90% 以上。
然而,这里出现了一个小麻烦。通过仅发送“差异”,系统必须不断地从内存中提取“旧”信息,以便将其与“新”信息进行比较,这在数据流水线中造成了交通拥堵。为了解决这个问题,团队加入了第二个技巧,叫做投机推理(speculative inference)。想象一下,有一位教练,他有一个反应敏捷的小助手来预测比赛接下来的几步动作,然后一位又大又慢但极其聪明的教练会对这些预测进行一次性的集体检查。这使得系统可以只加载一次沉重的数据,并利用它来验证多个步骤,从而缓解了交通拥堵。
为了实现这一切魔力,研究人员不仅编写了软件,还专门设计了一款用于处理这些“差异”计算的定制硬件芯片(加速器)。他们创建了一条由微型处理器组成的特殊流水线,这些处理器完美协作,确保没有人会在等待数据时闲置。
他们的实验结果令人印象深刻。当他们将 Deltoris 与标准移动计算芯片(如高端手机中的芯片)以及其他专门的机器人芯片进行对比测试时,这是一场压倒性的胜利。Deltoris 的速度比移动 GPU 快达 34.2 倍,比之前的专用加速器快 6.1 倍。或许更重要的一点是,它的能耗降低了高达 822 倍,这对于电池驱动的机器人来说意义重大。团队还检查了这些快捷方式是否会让机器人产生困惑;结果显示准确度几乎保持不变,性能仅有极微小的、可以忽略不计的下降。
简而言之,Deltoris 表明,通过对“计算什么”(只计算变化)以及“如何计算”(将预测分组在一起)进行优化,我们终于可以赋予具身智能(embodied AI)在现实世界中实时移动所需的的速度和效率。这是迈向让机器人不仅能思考,而且能像人类一样快速行动的重要一步。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。