✨ 要点🔬 技术摘要
想象一下,你正试图在跑马拉松的同时,解开一个巨大的、不断变化的拼图。在机器人的世界里,这个拼图就是一组被称为“矩阵方程”的数学问题。这些方程构成了机器人的大脑,不断计算着它在哪里、要去哪里,以及如何避免碰撞。棘手之处在于,拼图的碎片(方程中的数字)每毫秒都在变化,因为机器人看到了新的障碍物或移动到了新的位置。
传统上,机器人使用数字计算机来解决这些拼图,数字计算机就像是超级快速的会计师。它们必须停下来,把数字写下来,将它们从记忆办公桌移到计算办公桌,完成计算,然后再把答案移回去。这种“搬运过程”既耗时又耗能,就像跑步者每走几步就要停下来系一次鞋带。科学家们一直试图构建一种不同类型的大脑,使用一种被称为“忆阻器”的微型电子开关。把忆阻器想象成一种神奇的海绵,它可以吸收特定量的水(电流)来代表一个数字。如果你将这些海绵排列成网格,只需让水流过它们,就能瞬间解开数学拼图,而无需移动任何数字。问题在于,这些海绵有点“笨拙”。准确改变它们的水位通常需要一个缓慢且重复的“猜测、检查并调整”的过程,这会消耗掉所有的时效和能量优势。
本文介绍了一种利用这些“笨拙海绵”快速且准确地解决机器人变化拼图的新方法。研究人员利用代工厂制造的硬件,开发了一个名为“mAIC”(基于忆阻器的模拟迭代计算)的系统。他们没有采用缓慢的“猜测与检查”法,而是创造了一个聪明的技巧,称为“AC-PoP”。想象一下,你需要将一个桶注满到特定的刻度线。与其一滴一滴地注水并在每滴之后检查水位,不如使用一张关于桶如何漏水和注水的特殊地图,来精确预测一次性应该倒入多少水。如果你稍微没达到目标,你的系统会有第二、第三和第四个海绵准备就绪,能够立即加入恰到好处的“修正水”来修复误差。这使得机器人可以瞬间更新其数学拼图,而无需经过缓慢的检查过程。
当他们在真实机器人导航路径和一项复杂的建图任务(称为 SLAM)上测试该系统时,结果令人瞩目。新系统解决数学问题的准确度几乎与最优秀的数字计算机完全一致。然而,它更快,且消耗的能量更少。与标准机器人计算机(NVIDIA Jetson)相比,新系统快了 4.4 倍,且能耗降低了 627.9 倍。即使与旧的、较慢的编程海绵的方法相比,这种新方法在更新拼图碎片时的速度也快了 345 倍。研究人员展示了通过将这种“一次性预测”技巧与持续的电流结合起来,机器人终于可以拥有一个能够实时更新思维的大脑,就像周围世界的变化一样快,且不会耗尽电池。
技术摘要:基于忆阻器的动态模拟迭代计算用于实时机器人自主系统
问题陈述 自主移动机器人(AMR)系统需要实时估计、优化和控制,这些功能从根本上由动态矩阵方程(A ( t ) x ( t ) = b ( t ) A(t)x(t)=b(t) A ( t ) x ( t ) = b ( t ) )支撑。与静态 AI 工作负载不同,诸如同步定位与地图构建(SLAM)和路径规划等机器人任务涉及必须根据变化的传感器输入和环境条件进行频繁更新的系数矩阵。目前的数字冯·诺依曼架构面临“存储墙”瓶颈,即在独立的存储单元与处理单元之间移动数据会在迭代求解过程中产生显著的延迟和能量开销。虽然基于忆阻器的模拟存内计算(ACIM)为高效执行矩阵-向量乘法(MVM)提供了一条充满前景的路径,但其在动态工作负载中的应用受到两个主要挑战的制约:
矩阵更新的高开销: 精确编程忆阻器电导通常需要迭代的“写入-验证”(WVP)过程,以补偿器件的随机性和变异性。在动态场景下,这些频繁更新带来的能量和延迟成本可能会抵消模拟加速带来的计算效益。
动态求解中的精度问题: 现有的混合模拟-数字求解器由于重复的模数(AD)和数模(DA)转换,面临数据传输开销问题。相反,全模拟求解器对器件偏差和电路缺陷较为敏感,如果不解决针对频繁变化矩阵的具体需求,实现高精度求解将非常困难。
方法论 作者提出了一种旨在高效准确求解动态矩阵方程的基于忆阻器的模拟迭代计算(mAIC)系统。该系统集成了两项核心创新:
模拟补偿预测单步编程(AC-PoP):
为了解决更新瓶颈,作者开发了一种方案,用单个预测脉冲结合模拟补偿来取代迭代式的 WVP。
利用预先表征的忆阻器宏观响应预测模型(Δ g = f ( V ) \Delta g = f(V) Δ g = f ( V ) ),系统计算出一个单一的编程脉冲,驱动器件趋向目标电导状态。
由于预测编程不可避免地会因器件间(D2D)和循环间(C2C)的变异而留下残余误差,该方案采用了一种分阶段补偿机制。残余误差被传递到后续的宏观(或循环)中进行修正,从而在无需迭代验证延迟的情况下实现精确的矩阵更新。
有符号矩阵更新通过差分编码方案(G N = G + − G − G_N = G_+ - G_- G N = G + − G − )处理,其中更新被分类为仅幅度变化或符号反转,以优化置位/复位操作。
连续时间模拟反馈求解器:
mAIC 系统实现了一种全模拟迭代架构,直接在模拟域内求解矩阵方程。
矩阵方程被转换为迭代形式(x i + 1 = B x i + f x_{i+1} = Bx_i + f x i + 1 = B x i + f )。迭代矩阵 B B B 通过由跨阻放大器(TIA)缩放的多个电导矩阵来实现。
该系统运行为一个闭环反馈电路,其中 MVM 的输出与向量项 f f f 相加,并反馈回下一轮迭代的输入。这实现了连续时间的收敛,而无需重复进行 AD/DA 转换。
硬件平台利用了 foundry 制造的 1-Kb 1T1R(一晶体管一电阻)TaOx 忆阻器宏观,并集成了包括微控制器、传输门和模拟加法器在内的 CMOS 电路。
核心贡献
AC-PoP 方案: 一种新型编程策略,能够在存在缺陷的忆阻器器件上实现精确、低延迟且能效高的动态矩阵更新,减少了对迭代式“写入-验证”周期的需求。
集成 mAIC 系统: 一个结合了 AC-PoP 与连续时间模拟求解器的硬件演示,在动态工作负载下实现了与软件相当的精度。
可扩展性分析: 对大规模稀疏矩阵方程的块状映射策略进行了评估,展示了该系统如何在处理大规模 SLAM 问题时减轻电路非理想性(如 IR 压降)的影响。
结果 系统使用 foundry 制造的忆阻器宏观在模拟及真实世界的机器人任务中进行了验证:
更新效率: 与传统的 WVP 相比,AC-PoP 方案在保持相当更新精度的同时,将矩阵更新能量降低了 101 倍 ,延迟降低了 345 倍 。
SLAM 后端优化: 在基于 KITTI 数据集的 SLAM 定位任务中,mAIC 系统实现了 0.09% 的相对电导映射误差(在 3 次补偿循环下)以及 4.57 × 10 − 4 4.57 \times 10^{-4} 4.57 × 1 0 − 4 的平均解误差。重建轨迹的平移误差为 0.49%,与基于 CPU 的直接求解器的 0.39% 误差相当。
真实世界路径规划: 在涉及变化环境中动态重规划的物理移动机器人实验中,与 NVIDIA Jetson 平台相比,mAIC 系统实现了 4.4 倍的处理器延迟降低 和 627.9 倍的能耗降低 。在 40 步重规划过程中,系统保持了约 1.85 × 10 − 3 1.85 \times 10^{-3} 1.85 × 1 0 − 3 的平均绝对解误差。
可扩展性: 使用行块映射策略进行大规模 SLAM 任务的 SPICE 仿真表明,即使随着矩阵规模的增加,系统也能在每次求解内 19.8 μs 内收敛,且相对于数字参考值的精度损失极小。
意义与主张 本文声称,这项工作推动了忆阻器计算从主要针对静态矩阵加速的范式向精确且动态可重构的模拟计算 迈进。通过 AC-PoP 方案解决频繁矩阵更新的关键瓶颈,作者证明了基于忆阻器的 ACIM 可以支持具有优于最先进数字边缘处理器能效和延迟特性的实时机器人自主功能。
作者将这种能力定位为未来边缘智能的基础,指出高效的忆阻硬件动态更新可以实现针对物理环境的在线自适应、原位学习以及持续的模型演进。这项工作并不声称解决了所有忆阻器计算的挑战,而是专门针对从静态到动态工作负载的转变,为复杂 AMR 应用提供了实现全集成 mAIC 芯片的可行路径。
每周获取最佳 electrical engineering 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。