← 最新论文
⚡ electrical engineering

Reliableformer: A Device Aware Framework for Reliable Memristor Transformer Accelerators

Reliableformer 是一个设备感知且物理一致的数字孪生框架,它将视觉 Transformer 映射到忆阻器交叉阵列上,以模拟非理想特性、评估权衡并应用电路级与软件级的缓解措施,从而实现可靠且可持续的模拟人工智能加速。

原作者: Ankush Kumar, Rupanjan Bhattacharyya

发布于 2026-08-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Ankush Kumar, Rupanjan Bhattacharyya

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

现代人工智能已经达到了这样一个阶段:其最大的优势同时也成为了其最危险的弱点。驱动从语言翻译到图像识别等一切功能的复杂网络需要惊人的电力来运行。在大型数据中心里,为这些系统供电以及为防止其过热而进行的冷却所消耗的能量正变得难以为继,产生的碳足迹威胁着要超过它们所提供的益处。工程师们正在寻找一种无需传统计算机那样大量消耗能源就能进行这些计算的方法。一条充满希望的路径涉及一种被称为“忆阻器”的内存芯片,它可以在同一处存储信息并执行计算,就像人类大脑一样。然而,这些芯片并不完美。其内部微小的电子元件容易出错、随时间漂移且行为难以预测,这会导致计算机犯错。在制造可能失败的昂贵硬件之前,研究人员需要一种能够在尽可能真实的虚拟环境中测试其设计的方法。

一个研究小组开发了一个名为 Reliableformer 的新框架来解决这个确切的问题。他们创建了一个高度详细的“数字孪生”——一个模拟基于忆阻器的计算机将如何处理现代人工智能所需复杂任务的虚拟模型。他们没有直接制造物理芯片并听天由命,而是将一种专门用于识别图像的特定人工智能网络,映射到了一个模拟的这些存储芯片阵列上。这个虚拟环境使他们能够观察单个芯片组件在微观层面的误差是如何向上层层传递,最终影响系统最终答案的。通过将他们的设计置于物理现实的严苛考验之下(例如导线中的电阻以及存储单元随时间流逝失去存储值的自然倾向),他们可以准确识别系统会在哪里崩溃以及如何修复,而这一切都发生在任何硬件被制造出来之前。

研究人员发现,这些新计算机最大的障碍不在于内存芯片本身,而在于读取结果的过程。在他们的模拟中,负责将模拟电信号转换回数字形式的组件占据了芯片总空间的一半以上,并且消耗了最多的能量。他们发现,仅仅试图提高这种读取过程的精度并不是答案,因为这会使芯片变得过于庞大且耗电。相反,他们找到了一个平衡点,使系统可以在仅具备足够精度的同时保持准确,而不浪费资源。他们还发现,存储单元在编程过程中产生的随机变化是最危险的准确性威胁,如果不加以管理,可能会导致系统完全失效。为了应对这一点,他们设计了一种策略,即每份信息都以多个副本的形式存储,系统通过对这些副本取平均值来抵消误差,就像进行多次测量以获得真实读数一样。

另一个重大发现是如何处理存储单元缓慢、稳定的漂移。随着时间的推移,这些芯片中的电荷会自然衰减,这通常会损坏数据。研究人员表明,由于这种衰减是以可预测的方式发生的,计算机只需调整其计算方式来补偿损失,从而有效地修正错误,而无需重写数据或消耗额外功率。他们还开发了一种方法,重新排列芯片上的数据,使最关键的信息位于最安全的位置,避开电阻最高的区域。当他们将这些修复措施结合在一起进行测试时,系统从原本会导致其失效的严重误差中恢复了过来,将其准确度恢复到了接近完美计算机的水平。

这项研究证实,虽然构建一台模仿大脑的全模拟计算机是可能的,但这需要平衡不同类型的误差与成本。研究人员将他们的虚拟模型与一个已经制造出的真实物理芯片进行了对比,结果高度吻合,足以证明其模拟的可靠性。这为工程师提供了一个可靠的工具,用以设计未来既强大又节能的机器。这项工作并不声称已经解决了所有问题,因为模拟是基于特定的图像识别任务,并且依赖于对芯片行为的模型化描述。然而,它提供了一套清晰的规则,指导如何构建这些设备,表明通过理解材料的物理特性并针对其缺陷进行设计,是可能创造出新一代既可持续又可靠的人工智能硬件的。研究结果表明,前进的道路不在于对抗硬件的缺陷,而在于设计出能够与这些缺陷共存的系统,将潜在的弱点转化为可控的挑战。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →