现代人工智能已经达到了这样一个阶段:其最大的优势同时也成为了其最危险的弱点。驱动从语言翻译到图像识别等一切功能的复杂网络需要惊人的电力来运行。在大型数据中心里,为这些系统供电以及为防止其过热而进行的冷却所消耗的能量正变得难以为继,产生的碳足迹威胁着要超过它们所提供的益处。工程师们正在寻找一种无需传统计算机那样大量消耗能源就能进行这些计算的方法。一条充满希望的路径涉及一种被称为“忆阻器”的内存芯片,它可以在同一处存储信息并执行计算,就像人类大脑一样。然而,这些芯片并不完美。其内部微小的电子元件容易出错、随时间漂移且行为难以预测,这会导致计算机犯错。在制造可能失败的昂贵硬件之前,研究人员需要一种能够在尽可能真实的虚拟环境中测试其设计的方法。
一个研究小组开发了一个名为 Reliableformer 的新框架来解决这个确切的问题。他们创建了一个高度详细的“数字孪生”——一个模拟基于忆阻器的计算机将如何处理现代人工智能所需复杂任务的虚拟模型。他们没有直接制造物理芯片并听天由命,而是将一种专门用于识别图像的特定人工智能网络,映射到了一个模拟的这些存储芯片阵列上。这个虚拟环境使他们能够观察单个芯片组件在微观层面的误差是如何向上层层传递,最终影响系统最终答案的。通过将他们的设计置于物理现实的严苛考验之下(例如导线中的电阻以及存储单元随时间流逝失去存储值的自然倾向),他们可以准确识别系统会在哪里崩溃以及如何修复,而这一切都发生在任何硬件被制造出来之前。
研究人员发现,这些新计算机最大的障碍不在于内存芯片本身,而在于读取结果的过程。在他们的模拟中,负责将模拟电信号转换回数字形式的组件占据了芯片总空间的一半以上,并且消耗了最多的能量。他们发现,仅仅试图提高这种读取过程的精度并不是答案,因为这会使芯片变得过于庞大且耗电。相反,他们找到了一个平衡点,使系统可以在仅具备足够精度的同时保持准确,而不浪费资源。他们还发现,存储单元在编程过程中产生的随机变化是最危险的准确性威胁,如果不加以管理,可能会导致系统完全失效。为了应对这一点,他们设计了一种策略,即每份信息都以多个副本的形式存储,系统通过对这些副本取平均值来抵消误差,就像进行多次测量以获得真实读数一样。
另一个重大发现是如何处理存储单元缓慢、稳定的漂移。随着时间的推移,这些芯片中的电荷会自然衰减,这通常会损坏数据。研究人员表明,由于这种衰减是以可预测的方式发生的,计算机只需调整其计算方式来补偿损失,从而有效地修正错误,而无需重写数据或消耗额外功率。他们还开发了一种方法,重新排列芯片上的数据,使最关键的信息位于最安全的位置,避开电阻最高的区域。当他们将这些修复措施结合在一起进行测试时,系统从原本会导致其失效的严重误差中恢复了过来,将其准确度恢复到了接近完美计算机的水平。
这项研究证实,虽然构建一台模仿大脑的全模拟计算机是可能的,但这需要平衡不同类型的误差与成本。研究人员将他们的虚拟模型与一个已经制造出的真实物理芯片进行了对比,结果高度吻合,足以证明其模拟的可靠性。这为工程师提供了一个可靠的工具,用以设计未来既强大又节能的机器。这项工作并不声称已经解决了所有问题,因为模拟是基于特定的图像识别任务,并且依赖于对芯片行为的模型化描述。然而,它提供了一套清晰的规则,指导如何构建这些设备,表明通过理解材料的物理特性并针对其缺陷进行设计,是可能创造出新一代既可持续又可靠的人工智能硬件的。研究结果表明,前进的道路不在于对抗硬件的缺陷,而在于设计出能够与这些缺陷共存的系统,将潜在的弱点转化为可控的挑战。
技术摘要:Reliableformer
问题陈述
尽管 Transformer 网络是现代 AI 的基石,但由于其高能耗和高冷却需求,在数据中心规模的应用面临严重的可持续性挑战。基于忆阻器交叉阵列的模拟存内计算(IMC)通过在模拟域执行向量-矩阵乘法(VMM),实现 O(1) 的时间复杂度,从而消除冯·诺依曼瓶颈,为解决该问题提供了潜在方案。然而,由于器件非理想性(如 IR 压降、编程偏差、保持力漂移和粘连故障)的存在,部署基于忆阻器的加速器受到了阻碍,这些因素会削弱计算精度。此外,制造此类硬件既缓慢又昂贵,因此需要一种预制备验证方法。现有的设计框架和数字孪生模型主要针对卷积神经网络(CNN)进行优化,无法应对 Transformer 架构特有的挑战,特别是自注意力乘积(Q⋅KT 和 A⋅V)具有动态且依赖数据的特性,这使得它们无法被预编程到静态交叉阵列中。
方法论
本文介绍了 Reliableformer,这是一个面向器件感知、端到端物理一致性的数字孪生框架,旨在将多头视觉 Transformer(ViT)映射到级联式忆阻器交叉阵列架构上。该方法通过以下几个集成阶段进行:
架构映射: 将用于 CIFAR-10 的六块多头 ViT 映射到级联 ReRAM 交叉阵列注意力数据通路(ReCAT)上。该过程利用了三种关键技术:
- 级联阵列: 通过跨阻放大器(TIA)将中间的 KT 和 V 乘积直接写入缓冲交叉阵列,绕过 ADC 转换,以隐藏写入延迟。
- 偏移二进制映射(Offset-Binary Mapping): 通过对输入和权重施加恒定偏移量来处理有符号操作数,从而允许在非负电导阵列中存储并实现无损恢复。
- ADC 虚拟化: 通过在阵列间进行时间复用共享 ADC 池,以提高利用率。
该框架在 50 个映射层中实现了 98.7% 的乘累加运算在内存中完成,仅保留逐元素操作(LayerNorm、GELU、Softmax)在数字域执行。
物理一致性仿真: 该框架集成了用于电路级评估的 DNN+NeuroSim V2.1 宏模型,以及用于精确物理分析的 功能阵列模拟器(FAST)。
- 第一层级扫描(Tier-1 Sweep): 参数扫描评估了 ADC 精度、单元精度、开/关比以及电导变化对精度、面积和能耗的影响。
- 精确物理: 框架采用稀疏修正节点分析(MNA)求解器来计算精确的 IR 压降效应,并使用基于物理的 Arrhenius 保持模型取代经验漂移定律,以处理随温度变化的退化。
缓解流水线: 开发了一个独立的、可审计的缓解流水线,用于对抗特定的非理想性,而不改变底层分析引擎。策略包括:
- IR 压降: 仿射逐交叉阵列校准、激活电流补偿以及敏感度感知型行重映射。
- 偏差与粘连故障: 利用单元冗余(R 个副本取平均)以及零权重/目标稀疏化映射,将故障引导至未使用的单元。
- 保持力: 基于预测的平均漂移因子进行时间感知缩放。
- 量化: 在“精度拐点”(5–6 bit)而非全精度下运行,以节省面积和能量,并结合范围自适应读取。
核心贡献
本文声称其贡献如下:
- 首个可在训练级宏模型上运行的 Transformer 数据通路: 它将完整的 ViT 映射到 DNN+NeuroSim V2.1 宏模型上,实现了 98.7% 的存内执行,这在以往该平台上针对 Transformer 的研究中从未得到证实。
- 规模匹配的量化: 它引入了一种规模匹配的权重与误差量化器,在正向和反向传播中均保持 8 位精度,防止了标准 WAGE 形式中常见的深度复合量级误差。
- Transformer 特有的敏感度定律: 作者推导出了闭式缩放定律,表明 ADC 精度和电导变化敏感度会随网络深度(L)复合增长,使得深层 Transformer 比浅层 CNN 对非理想性更为敏感。
- 精确器件物理可靠性分析: 这是首个在整个 Transformer 编码器中应用逐交叉阵列物理评估(精确 MNA IR 压降和 Arrhenius 保持力)的研究。
- 可审计的缓解流水线: 通过将分析路径与缓解路径分离,该框架能够量化每种对策带来的精确精度恢复和硬件成本。
- 现实性验证: 该框架通过一个制造好的全模拟钙钛矿 Transformer 引擎进行了基准测试,证实了所提策略的方向性现实性,同时也强调了使用 foundry 兼容的 TaOx/HfOx 材料与不稳定钙钛矿材料之间的权衡。
结果
- 器件敏感度: 第一层级扫描确定 ADC 精度 是主要的成本和精度驱动因素(在 5 bit 时贡献了约 52% 的芯片面积),而 电导变化 是最严峻的精度风险(在 σ≥0.15 时,在零硬件成本下会导致精度崩塌至随机水平)。
- 缓解有效性: 在匹配的非理想条件下,缓解流水线实现了显著恢复:
- 保持力: 在 85°C 下经过 105 秒后,通过时间感知缩放,精度从 16.3% 恢复至 79.7%。
- 偏差: 在 γ=0.2 时,通过 3 副本冗余,精度从 46.0% 提升至 64.3%。
- IR 压降: 在高线电阻(8Ω)下,通过仿射校准和重映射,精度从 66.7% 恢复至 88.9%。
- 粘连故障: 通过零权重映射和冗余,精度翻倍(例如,在 1% 故障率下从 19.7% 提升至 41.0%)。
- 成本权衡: “拐点”操作(5–6 bit ADC)相比 8 bit 操作减少了约 46% 的芯片面积和约 47% 的能耗。这些节省出的资源足以支付 3 副本冗余所需的约 56% 面积开销,使得缓解后的设计能够在保持与 8 bit 基准相当或更低成本的同时,实现精度的恢复。
意义与主张
本文将 Reliableformer 定位为第一个专门针对 Transformer 架构的端到端、物理一致性的数字孪生。不同于以往侧重于 CNN 或仅解决单一维度(如数据流或特定非理想性)的工作,该框架集成了架构映射、全器件级非理想性分析、缓解措施、电路级基准测试以及数字孪生。
作者总结了 七项可迁移的设计原则,适用于忆阻器 Transformer 加速器:
- 优先预算 ADC: 它是主要的成本和精度瓶颈;应在精度拐点处运行。
- 将编程偏差视为最严峻的风险: 它在零硬件成本下会导致精度崩塌;冗余是必不可少的。
- 补偿 IR 压降: 不要仅仅容忍它,而要使用仿射校准和敏感度感知布局。
- 利用可预测的漂移: 保持力损失是可预测的平均缩放;使用时间感知读取缩放。
- 将零映射到故障上: 将稀疏注意力权重与粘连单元对齐,以抵消损伤。
- 协同优化电导窗口: 平衡开/关比与线电阻及偏差预算。
- 保持分析与缓解分离: 这确保了精度增益可以被审计归因于特定的机制。
研究结论指出,虽然该框架在 CIFCIF-10 上进行了验证作为概念证明,但其架构结论和设计原则具有规模不变性,并适用于更大的模型,前提是主导的非理想性会随操作场景和材料选择而变化。这项工作为硬件工程师提供了一个去风险化工具,使其可以在制造前校准器件参数并选择对策。
每周获取最佳 electrical engineering 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。