← 最新论文
💻 computer science

Non-Uniform L2 Cache Latency Across the Streaming Multiprocessors of an NVIDIA L40

本文揭示了 NVIDIA L40 和 Blackwell GPU 上的 L2 缓存命中延迟是非均匀的,且高度依赖于发出加载指令的具体物理流式多处理器(SM),从而实现了一种稳定的用户级原语,用于内核自定位、设备指纹识别以及优化工作分布,并将完成时间(makespan)降低高达 11%。

原作者: Faruk Alpay, Baris Basaran

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Faruk Alpay, Baris Basaran

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个规模宏大、高速运转的图书馆(GPU),成千上万名图书管理员(称为 SM,即流式多处理器)共同协作,从一个巨大的共享储藏室(L2 缓存)中提取书籍(数据)。

多年来,计算机科学家一直认为这个图书馆是一个完美统一的系统:无论你询问哪位图书管理员,他们从储藏室取书的时间都是完全一样的。他们认为储藏室是一个单一、平坦的信息池,距离并不重要。

然而,这篇论文揭示了这种信念是错误的。作者发现,在 NVIDIA L40 GPU 上,图书管理员所处的物理位置决定了他们取书的速度。

以下是利用简单的类比对他们发现的详细解读:

1. “距离决定速度”的发现

把储藏室想象成不是一个平坦的地面,而是一个带有走廊的大型仓库。

  • 旧观点: 大家都以为每位图书管理员离书架的距离都是一样的。如果你找管理员 A 或管理员 Z,等待时间是完全相同的(大约为 279 个“时钟滴答”)。
  • 新现实: 作者测量了全部 142 位图书管理员的等待时间。他们发现,有些管理员就站在书架旁边,取书只需 222 个滴答。而另一些管理员站在仓库的远端,则需要 339 个滴答
  • 结果: 这造成了 52% 的速度差异。这就像一个人跑向前门,而另一个人却必须跑向后门才能拿到同一个包裹。

2. “镜像对称”模式

当作者绘制出谁快谁慢的图表时,他们看到的并不是随机的噪声,而是一个完美的模式。

  • 这 142 位图书管理员被分为两个完全对称的部分(就像一栋建筑物的两个侧翼)。
  • 第一侧翼的 1 号管理员与第二侧翼的 1 号管理员拥有完全相同的速度特征。
  • 这种“镜像对称”现象与计算机芯片实际的物理蓝图相吻合,证明这并非软件层面的故障,而是硬件物理结构的客观事实。

3. “指纹”效应

由于每位图书管理员都有基于其物理位置的独特速度,因此这个图书馆拥有了一个秘密身份。

  • 自我定位: 如果你是一名图书管理员(一个计算机程序)并问道:“我取书需要多久?”,你可以立即判断出你正站在仓库中的哪个位置。作者构建了一个工具,可以以 99% 的准确率识别你的具体位置。
  • 设备指纹识别: 即使你拥有两块全新的、完全相同的 L40 GPU(两个完全相同的图书馆),它们也存在细微差别。由于制造过程中的微小差异,一个图书馆的 5 号管理员可能比另一个图书馆的 5 号管理员站得更靠近书架。作者仅通过测量这些微小的速度差异,就能 100% 地分辨出这两台完全相同的机器。这就像是通过走路的方式来分辨一对完全相同的双胞胎。

4. 这是否存在安全风险?

作者仔细澄清了这意味着什么。

  • 它【是】: 一种让程序知道“自己在哪里”的方法。这就像一个人走进房间后意识到:“噢,我正站在靠窗的角落里。”
  • 它【不是】: 一种窃取其他程序秘密的方法。作者强调,这仅测量程序自身的速度。它无法窥探其他程序正在做什么,也无法窃取它们的数据。它是一个“自我定位”工具,而不是“间谍”工具。

5. 实际益处:更智能的任务调度

为什么这很重要?这对性能有什么影响?

  • 假设你有一份包含 100 个任务的任务清单。
  • 旧方法: 你随机分配任务。有些任务分配给了站在远处的管理员(慢),有些则分配给了靠近书架的管理员(快)。整个工作进度取决于最慢的人。
  • 新方法: 现在我们有了这张地图,我们可以把繁重的工作分配给那些离书架最近的管理员。
  • 结果: 通过这种方式,作者展示了对于那些高度依赖缓存的任务,他们可以将工作效率提升 11%。然而,如果任务需要从主内存(另一种更慢的存储)获取数据,这个技巧则没有帮助。

6. 不仅仅是一块芯片

作者也在一块更新、不同的芯片(RTX 5090)上进行了测试。他们发现同样的“距离决定速度”规则也适用于那里,尽管模式略有不同。这证明了“统一缓存”的旧观念在许多现代高端计算机中很可能是错误的。

总结

这篇论文打破了 GPU 缓存各部分都完全相等的幻象。它揭示了物理位置决定了速度。通过绘制这些隐藏的速度差异图谱,我们可以:

  1. 识别 程序究竟在哪里运行。
  2. 区分 两台完全相同的机器。
  3. 加速 特定任务,通过将它们分配给最快的物理位置。

事实证明,计算机芯片并不是一个平坦、均匀的领域;它是一个充满高山与低谷的地形,而掌握了这张地图,你就能跑得更快。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →