← 最新论文
🤖 machine learning

DCC: Data-Centric Compilation of Machine Learning Kernels for Processing-In-Memory Architectures

本文提出了 DCC,这是首个面向存内计算(PIM)系统的以数据为中心的编译器,它通过联合优化数据重排与计算代码以克服内存访问不匹配问题,从而在多种 PIM 架构上为机器学习内核和大语言模型推理实现了显著加速。

原作者: Peiming Yang, Sankeerth Durvasula, Ivan Fernandez, Mohammad Sadrosadati, Onur Mutlu, Gennady Pekhimenko, Christina Giannoula

发布于 2026-05-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Peiming Yang, Sankeerth Durvasula, Ivan Fernandez, Mohammad Sadrosadati, Onur Mutlu, Gennady Pekhimenko, Christina Giannoula

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你正在运营一座庞大的图书馆(机器学习模型),需要从中找到特定的书籍(数据)来回答问题。

问题:两种不同的图书管理员风格
在传统计算机中,你有一位超级快速的图书管理员(GPU),他在一个巨大的中央办公室工作。为了高效工作,这位管理员需要书籍按特定方式排列:第 1 本、第 2 本和第 3 本书必须放在不同的书架上,这样管理员才能同时从不同的过道中抓取它们。

然而,你还有另一位全新的、超级高效的助手(PIM 设备),他直接在书架旁边工作。这位助手阅读速度极快,但他只能触及自己特定书架上的书籍。如果书籍分散在不同的过道,助手就必须来回奔跑,这非常缓慢。

为了使用这位新助手,你必须取出书籍,重新排列,使第 1、2、3 本书都位于同一个书架上供助手使用,让他们完成工作,然后再重新排列书籍,将其恢复为中央办公室的格式,以便主管理员使用。

旧方法:手工操作
此前,程序员必须手动找出整理这些书籍的最佳方式。他们不得不猜测:“我应该在这个书架上放 10 本书吗?还是 20 本?”如果猜错了,助手花在整理书籍上的时间就会超过实际阅读的时间。这就像在时钟滴答作响时试图手工整理图书馆——既缓慢又容易出错,而且不同的图书馆(不同的硬件)需要完全不同的整理规则。

解决方案:DCC(智能图书管理员助手)
这篇论文介绍了DCC,这是一个新的“智能系统”,充当这座图书馆的总规划师。DCC 不仅仅是告诉助手读什么,它还同时找出最佳的书籍排列方式以及最佳的指示助手阅读的方式。

以下是 DCC 的工作原理,使用简单的比喻:

  1. 通用翻译器(多层抽象):
    不同的图书馆有不同的布局(有些有 4 个过道,有些有 8 个)。DCC 使用一种通用语言。它不在乎你使用的是三星图书馆还是 SK 海力士图书馆;它将“书籍排列规则”翻译成它理解的格式,从而能够与任何硬件协同工作。

  2. “如果”模拟器(以数据为中心的调度生成器):
    DCC 不再靠猜测,而是在其内部运行数千次模拟。它会问:“如果我们在书架 A 上放 4 本书会怎样?如果放 8 本呢?”它会审视整个过程——包括整理时间加上阅读时间。

    • 旧方法: “让我们让阅读变得超级快!”(忽略了整理需要耗费漫长时间)。
    • DCC 的方法: “如果我们稍微调整阅读计划,就能将整理时间减半。那才是真正的赢家。”它在移动书籍和阅读书籍之间找到了完美的平衡点。
  3. 速度预测器(耦合性能预测器):
    DCC 就像一位看过数千场比赛的资深教练。它不需要运行每一次模拟就能知道哪一个是获胜方案。它利用“学习模型”瞬间预测出最快的计划。这意味着它不会浪费时间去测试糟糕的想法。

  4. 交通控制器(代码优化器):
    一旦 DCC 选定了最佳方案,它就会组织交通。它确保当助手抓取书籍时,能够完美地批量抓取(就像一次抓取一整摞书),从而不浪费任何时间等待下一本书。

结果:快了多少?
该论文在现实世界的任务上测试了此系统,例如运行大型语言模型(生成文本或回答问题的 AI)。

  • 速度提升: 在一种硬件(AttAcc)上,DCC 使 AI 的速度比仅使用主计算机(GPU)快了13 倍。在另一种硬件(HBM-PIM)上,速度快了7.7 倍
  • 现实世界测试: 当运行与 AI 的完整对话(如 GPT-3 或 LLaMA-2)时,DCC 使整个过程平均快了4.5 倍
  • “魔法”技巧: 最大的惊喜在于,旧方法只专注于让“阅读”部分变快。DCC 意识到“整理”部分实际上是瓶颈。通过同时优化整理和阅读,它解锁了巨大的速度提升。

总结
将 DCC 想象成繁忙城市的终极交通控制器。以前,交通信号灯的设置仅基于汽车行驶的速度,而忽略了交叉路口的交通拥堵。DCC 审视整张地图,意识到拥堵才是问题所在,并同时调整交通信号灯的时间表和道路布局,从而使整个城市的交通运行得更快。

该论文声称,这是首个针对这些新型存储设备上的 AI 任务进行这种“联合优化”的系统,使其在 AI 的未来发展中变得实用且极其快速。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →