← 最新论文
💻 computer science

AMORL: A Training-Aware, Adaptive, Multi-Objective RL-CNN Framework for Dynamic DNN Mapping on Networks-on-Chip

本文介绍了 AMORL,这是一个感知训练的自适应框架,它结合了强化学习和卷积神经网络,将多样化的 DNN 工作负载动态地映射到异构片上网络(NoC)上,在保持高吞吐量和高能效的同时,显著降低了通信成本、负载不均衡和延迟。

原作者: Md Farhadur Reza

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Md Farhadur Reza

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代计算世界中,最强大的机器不再由单一的、庞大的大脑来定义,而是由成千上万个协同工作的微型处理器组成。想象一座城市,数百万名微小的工人必须不断地互相传递便条,以解决一个单一且复杂的难题。如果他们之间的道路发生拥堵,整个城市就会陷入停滞。这就是驱动当今人工智能(从图像识别到语言翻译)的深度神经网络所面临的现实。这些系统由人工神经元层构建而成,这些神经元以巨大且复杂的模式进行通信。为了高效运行这些系统,工程师将这些神经元放置在被称为“多核系统”的专用芯片上,其中处理器通过被称为“片上网络”(Network-on-Chip)的微型导线网络连接在一起。这个内部网络充当了芯片的循环系统,在处理器之间传输数据。然而,随着这些人工大脑变得越来越大、越来越复杂,这些内部道路上的交通流量成为了瓶颈。传统的决策方法——即决定哪个处理器处理哪部分计算——往往无法考虑到不同人工智能模型独特的、变化的各种需求,从而导致能量浪费、过热和性能下降。

伊利诺伊东方大学的一位研究人员开发了一种解决这一交通问题的新方法,他们称之为 AMORL 系统。该系统并非使用一套固定的规则来分配任务给处理器,而是学习如何动态地映射数据流,就像一个智能交通控制中心,根据当前的拥堵情况实时调整信号灯的时长。研究人员结合了两种强大的技术来训练他们的系统:一种是强化学习,它允许计算机通过试错进行学习;另一种是卷积神经网络,它有助于系统识别数据移动中的空间模式。通过教导系统将整个芯片视为一张地图,它可以识别哪些处理器处于闲置状态,哪些处于过载状态,然后立即重新规划信息流向,以保持一切平稳运行。

AMORL 的核心创新在于其能够适应不同人工智能模型的特定需求以及芯片本身不断变化的情况。研究人员在六种不同类型的神经网络上测试了该系统,范围涵盖了用于基础图像分类的简单模型,到像 ResNet-50 和 BERT-tiny 这样庞大且复杂的架构。他们模拟了这些模型在不同规模的芯片网络上运行的情况,从包含 16 个处理器的微型网格到超过一千个处理器的巨型阵列。该系统旨在处理整个训练阶段的生命周期,因为它意识到人工大脑在学习过程中的通信需求是会变化的。在学习的初始阶段,系统向前发送数据;随后,它向后发送误差信号以纠正错误;最后,它更新其内部权重。AMORL 学习为这些阶段中的每一个阶段优化任务放置,确保最关键的数据走最短的距离。

在他们的模拟实验中,结果非常显著。与依赖随机分配或标准优化算法的旧有映射策略相比,AMORL 框架将通信成本降低了 70% 以上。这意味着数据在处理器之间的跳转次数显著减少,大幅缩短了系统完成任务所需的时间。该系统还将负载均衡能力提高了高达 86%,确保没有单个处理器在其他处理器过载时处于闲置状态。或许最重要的一点是,系统在实现这一目标的同时,保持了较低的能耗并防止了芯片过热。研究人员在学习过程中加入了一个热安全指标,允许系统自动将任务从过热的处理器转移开,从而避免芯片为了降温而被迫降速。

为了验证这些发现是否在现实条件下依然成立,研究人员通过一个高度详细的、能够模拟芯片网络物理行为的周期精确模拟器运行了他们的映射方案。他们在 4x4 处理器网格和更大的 8x8 网格上测试了系统,并通过提高数据注入率来观察系统在重度交通压力下的表现。在较小的网格上,系统维持了高达 876 Gbps 的吞吐量。在较大的 8x8 网格上,它实现了超过 2.77 Tbps 的惊人吞吐量。这些数字表明,该系统不仅在理论上可行,而且即使在网络承受巨大压力时也能保持高效。模拟证实,AMORL 生成的映射可以处理现实世界中人工智能工作负载的多样且不可预测的需求,而无需在引入新模型时每次都从头开始重新训练系统。

研究人员还探讨了其系统的不同组件是如何促成成功的。他们发现,负责动态权衡不同目标(例如速度与能效之间)的部分是最关键的因素。当他们移除这种自适应权重时,系统的性能显著下降,这证明了对于这些复杂任务,单一的方法是行不通的。同样,识别芯片上空间模式的组件对于降低通信成本至关重要,尤其是在芯片规模增加的情况下。该系统还展示了对工作负载突发变化的快速适应能力。如果数据类型或任务规模在操作过程中发生变化,系统可以进行快速调整,而无需经历完整的重新训练周期,从而确保持续的高性能。

这项工作代表了在提高人工智能硬件效率和适应性方面迈出的重要一步。通过教会芯片如何组织自身的内部交通,研究人员创建了一个可以从小型、简单网络扩展到未来大规模、复杂系统的框架。这种对速度、能量和热量管理进行联合优化的能力,意味着未来的 AI 加速器可以运行得更快、更凉爽,能够处理更多样化的任务,而无需不断的干预。研究结果表明,随着我们向拥有数千个核心的芯片迈进,释放其全部潜力的关键不仅在于增加更多动力,还在于教会它们如何智能地共享这些动力。AMORL 框架为这种智能提供了一个蓝图,表明通过正确的学习策略,这些复杂的系统可以在数字景观中找到属于它们的最优路径。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →