✨ 要点🔬 技术摘要
那些能够像生物一样拥有流畅优雅动作的机器人,依赖于其传感器与肌肉之间持续且高速的对话。这场对话的核心是一套被称为刚体动力学(rigid body dynamics)的计算过程。这些数学规则决定了机器人的肢体如何摆动、举起物体需要多少力量,以及机器人在踉跄时会如何反应。为了让机器人实现实时运动,这些计算必须每秒钟进行数千次。如果机器人内部的计算机速度太慢,机器就会出现顿挫或摔倒;如果计算机体积太大或耗电过多,则无法由无人机或步行机器人携带。多年来,工程师们一直试图制造专门的芯片来加速这些计算,但芯片本身已成为瓶颈。它们通常体积过大且耗电过多,无法安装在机器人的边缘侧(edge),这迫使人们在机器人的智能化程度与续航时间之间做出艰难的权衡。
挑战在于数学本身的性质。为了让这些计算更快,工程师经常使用一种称为“量化”(quantization)的技术,即简化计算机使用的数字。想象一下,用一把只有英寸刻度的尺子与一把带有毫米刻度的尺子相比,测量到墙壁的距离,前者读起来更快但精度较低。过去,研究人员尝试使用相同的精度水平来简化机器人计算中的每一个数字,就像在整个工作中都使用只有英寸刻度的尺子一样。这种方法虽然简单,却很浪费。它将每个数字都视为需要同等水平的细节,即便有些计算部分是宽容的,而另一些则是关键的。特定计算中的微小误差可能导致机器人偏离航线,但另一部分的巨大误差可能不会被察觉。问题在于,为每一个数字寻找完美的精度平衡,就像是在一个不断变化的草堆中寻找一根针。
香港科技大学的一个研究团队开发了一种名为 APEX-RBD 的新框架来解决这个问题。该系统不再强求每个数字都保持一致,而是能自动确定计算中每个部分究竟需要多少精度。他们意识到,机器人在大脑中的某些变量对误差高度敏感,而另一些则不然。通过给予敏感部分高精度,并给予不太敏感的部分低精度,他们可以在不让机器人摔倒的前提下,显著缩小硬件规模。然而,这些不同精度水平的可能组合数量极其庞大,以至于逐一检查需要耗费数年时间。为了克服这一难题,研究人员构建了一个智能探索者,它能够学习在无需运行完整的、耗时的模拟过程的情况下,预测设计的输出结果。
该框架通过三个不同的阶段来驯服这种复杂性。首先,它根据变量在物理上的行为方式,将机器人计算中的数千个变量进行分组。然后,它分析每一组对误差的敏感程度,从而绘制出一张显示哪些数字最重要的地图。仅这一步就减少了计算机需要考虑的可能性。接着,系统训练一个轻量级模型来充当“水晶球”。该模型不再需要为每一个新的设计构思都进行长达数小时的完整机器人运动模拟,而是能在毫秒内预测最终结果。它从一小组示例中学习,利用敏感度地图来理解系统某一部分的误差是如何波及到最终运动的。最后,系统使用一种混合搜索策略来寻找最佳配置。它结合了旨在寻找潜力区域的广泛搜索,以及通过调整特定变量的精度来压榨出最后一点效率的精细调节过程。
当研究人员在三种截然不同的机器人——一个七关节机械臂、一个十二腿四足机器人和一个二十九关节的人形机器人——上测试这种方法时,他们发现了显著的改进。与所有数字都被平等对待的标准方法相比,他们的优化设计将硬件的物理尺寸缩小了高达 1.9 倍,并将功耗降低了高达 1.8 倍。这些节省是在保持机器人运动精度与之前完全一致的情况下实现的。该系统能在标准工作站上约十小时内找到这些高效的设计,而这在旧方法下是不可能完成的任务。这项工作表明,通过理解机器人“大脑”中每个部分的独特需求,工程师可以制造出更小、更节能、且能够在边缘侧执行复杂任务的机器,让我们离机器人能在我们的世界中自由自主运动的未来更近了一步。
APEX-RBD 技术摘要
问题陈述 刚体动力学(RBD)计算是实时机器人控制的核心计算任务,通常占据控制器高达 90% 的运行时间。虽然专用硬件加速器可以解决这一瓶颈,但由于面积和功耗成本高昂,其在资源受限的边缘平台上的部署受到了阻碍。量化技术为降低这些成本提供了一条路径,通过缩小算术单元的规模来实现,但现有方法面临显著局限:
均匀精度效率低下: 当前的最先进技术(如 DRACO)采用均匀精度量化,为所有变量分配相同的位宽。这种“一刀切”的策略忽略了不同的 RBD 变量对运动精度损失的敏感度各不相同,从而导致了不必要的硬件开销。
搜索空间难以处理: 转向混合精度量化(为每个变量定制位宽)会产生组合爆炸。对于涉及约 50 个变量、每个变量有 12 种可选位宽的算法,论文中描述的搜索空间超过了 1250(原文可能存在印刷错误,实际应为 12 50 12^{50} 1 2 50 ,但文中明确表述为“超过 1250”)。
评估成本过高: 验证混合精度配置需要端到端的闭环仿真,以验证轨迹保真度和系统稳定性。这一过程计算成本极高(例如,验证 100 个候选方案需 8.5 小时),使得暴力搜索或像强化学习这样依赖大量数据的算法变得不再可行。
方法论:APEX-RBD 框架 APEX-RBD 是一个旨在高效导航这一庞大搜索空间的自动化框架。它通过三个截然不同的阶段,在用户定义的精度和性能约束下,识别用于专用集成电路(ASIC)的高硬件效率混合精度配置。
阶段 1:物理驱动的搜索空间剪枝
变量分组: 框架不再对每个变量进行单独量化,而是根据变量在 RBD 算法(如 RNEA、Minv)中的物理和算法角色进行分组。这显著降低了搜索的维度。
敏感度分析: 框架通过模块级仿真来分析各组内的位宽变化如何影响输出误差(例如扭矩误差)。该分析确定了防止溢出所需的整数位宽,并生成敏感度曲线。
组合并: 对于具有相似敏感度特征的组,在不违反模块级误差阈值的前提下进行合并,以进一步压缩搜索空间。
阶段 2:数据高效的代理模型
为了绕过闭环仿真的瓶颈,APEX-RBD 训练了一个代理模型,可以在毫秒级内预测轨迹误差。
分层特征工程: 模型并非学习从位宽到误差的直接端到端映射,而是将问题进行分解。它首先预测模块级误差(例如 RNEA 扭矩误差),然后将这些预测结果结合领域特定启发式规则(例如误差比例、递归链依赖关系)作为最终轨迹误差预测器的特征。
模型选择: 选择随机森林(RF)模型,因其在小数据集上具有鲁棒性。该框架使用通过端到端仿真生成的极少量数据集(100 个样本)进行训练,使这一过程在硬件-软件协同设计中具有可行性。
阶段 3:硬件感知的混合搜索
解析成本估算器: 基于单元库(cell-library)的解析模型用于估算任何给定位宽配置下的硬件面积和功耗成本。
混合优化: 框架采用贝叶斯优化(BO)进行全局探索,以寻找设计空间中的潜力区域。随后采用两种局部精细化启发式算法:
成本驱动的贪婪精细化: 优先降低对硬件影响最大的组的位宽,若违反误差阈值,则通过提高低敏感度组的精度来进行补偿。
敏感度引导的调优: 在高敏感度和低敏感度组之间系统地权衡精度,以实现效率最大化。
验证: 通过严格的端到端仿真验证顶层候选方案,以选择最终的最优配置。
核心贡献
首个 RBD 混合精度框架: APEX-RBD 是第一个实现 RBD 计算混合精度量化自动化的框架,针对具有特定运动精度和吞吐量约束的 ASIC 部署。
通过剪枝与代理实现可处理的搜索: 它引入了一种结合物理驱动变量分组/敏感度分析与少样本、先验信息驱动代理模型的创新方法。这使得仅通过 100 个训练样本即可实现准确的轨迹误差预测,且耗时仅为毫秒级。
硬件感知优化: 该框架利用基于单元库的解析成本估算器和混合优化器(BO + 局部启发式算法),能够高效识别近乎最优的设计,从而最小化面积和功耗。
实验结果 该框架在三种不同的机器人平台(7 自由度 iiwa 机械臂、12 自由度 HyQ 四足机器人以及 29 自由度 Atlas 类人机器人)上进行了评估。
硬件效率: 与均匀精度基准(24 位和 32 位)相比,APEX-RBD 在保持相同运动精度的同时,实现了高达 1.9 倍的面积缩减 和 1.8 倍的功耗缩减 。
搜索效能: APEX-RBD 在寻找低成本设计方面优于其他搜索算法(随机搜索、模拟退火、纯贝叶斯优化)。具体而言,局部精细化启发式算法比纯贝iously 优化提供了高达 1.5 倍的面积节省和 1.3 倍的功耗节省。
运行时间: 对于复杂机器人(iiwa),整个探索过程在标准工作站上完成约需 10.8 小时 。大部分时间(78.95%)都花在了初始数据收集(仿真)上,这凸显了代理模型成功替代了数千次仿真需求,从而优化了优化阶段的过程。
意义 论文声称,APEX-RBD 解决了将量化应用于机器人控制回路中的关键障碍,因为误差传播可能导致系统不稳定。通过超越均匀精度的限制,该框架释放了 ASIC 定制化在 RBD 加速器方面的全部潜力。它证明了通过物理启发式剪枝和数据高效的学习,曾经被认为难以处理的混合精度探索(由于搜索空间巨大和仿真成本高昂)是可以实现计算可行性的。这使得在不牺牲运动精度的情况下,部署更高效、更兼容边缘侧的机器人控制器成为可能。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。