← 最新论文
⚛️ high-energy experiments

A converged architecture for processing 32 Tbps of physics data in real-time at the LHCb experiment

LHCb 实验已成功实现了一种基于全 GPU 的收敛架构,利用零拷贝网络技术处理前所未有的 32 Tbps 实时粒子碰撞数据,为物理实验中的高吞吐量数据过滤设定了新标准。

原作者: Roel Aaij, Christina Agapopoulou, Thomas Boettcher, Dorothea vom Bruch, Daniel Hugo Cámpora Pérez, Adrian Casais Vidal, Tommaso Colombo, Daniel C. Craik, Tim Evans, Placido Fernandez Declara, Marianna
发布于 2026-07-24
📖 1 分钟阅读🧠 深度阅读

原作者: Roel Aaij, Christina Agapopoulou, Thomas Boettcher, Dorothea vom Bruch, Daniel Hugo Cámpora Pérez, Adrian Casais Vidal, Tommaso Colombo, Daniel C. Craik, Tim Evans, Placido Fernandez Declara, Marianna Fontana, Vladimir V. Gligorov, Arthur Hennequin, Louis Henry, Brij Kishor Jashal, Saverio Mariani, Rosen Matev, Niklas Nolte, Niko Neufeld, Arantza Oyanguren, Alberto Perro, Flavio Pisani, Renato Quagliani, Florian Reiss, Kate A. Richardson, Alessandro Scarabotto, Rainer Schwemmer, Patrick Spradlin, Marian Stahl, Jiahui Zhuo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一台巨大的高速摄像机,它拍摄的不是日落或小狗,而是宇宙中最微小的构建块相互碰撞的瞬间。这就是粒子物理学的世界,科学家们利用被称为“对撞机”的巨型机器,每秒钟让粒子以数十亿次的速度相互轰击。当这些粒子发生碰撞时,会产生一场新的粒子混沌爆炸,就像打碎一个花瓶以观察其内部构造一样。其目标是捕捉隐藏在这些碎片中的某种罕见且新颖的现象。但问题在于:摄像机速度极快,碰撞频率极高,产生的数据量巨大——如此之多,以至于每秒钟产生的数据就能填满数百万个硬盘。如果科学家试图保存每一条数据,他们的计算机将会过热,存储空间也会瞬间耗尽。

为了解决这个问题,物理学家使用了一种“过滤器”或“触发器”。你可以把它想象成一个非常高级俱乐部的保镖。保镖必须在极短的时间内做出决定,判断哪些碰撞足够有趣值得保留,而哪些只是可以丢弃的无聊背景噪声。几十年来,这些保镖是由专门的硬件和计算机软件组成的混合体。但随着机器变得越来越快,旧的保镖跟不上节奏了。它们太慢、太僵化,经常仅仅因为碰撞看起来不像硬件预期的那样,就将有趣的事件丢弃掉。于是,一个大问题出现了:我们如何构建一个既能处理海量数据,速度又够快,既能洞察全局,又足够聪明,且能随时改变判断的过滤器?

这篇论文讲述了大型强子对撞机(LHC)中的 LHCb 实验如何通过一次大规模升级解决了这一问题。团队构建了一个全新的系统,它就像一个超高效的全能工厂。他们不再使用分工明确、步骤繁琐的多级处理过程,而是创建了一个“融合架构”。这意味着他们将数据采集、排序和过滤整合进了一个流线型的过程中,并运行在通常用于游戏电脑的强大图形处理器(GPU)上。他们成功实现了实时处理高达每秒 32 Terabits 的数据。这是软件处理过的最高数据速率。通过移除旧有的、僵化的硬件过滤器,并将其替换为智能、灵活的软件系统,他们不仅跟上了速度,还提升了科学研究的质量,确保没有任何罕见且令人兴奋的事件会从缝隙中溜走。

问题所在:数据洪流

大型强子对撞机(LHC)每秒将粒子碰撞数十亿次。每一次碰撞被称为一次“事件”。过去,LHCb 实验使用两步式的过滤系统。首先,由专门定制的电子设备组成的“低级触发器”会对数据进行快速扫描,并丢弃大部分无聊的碰撞。只有那些看起来有希望的碰撞才会传递给“高级触发器”(软件)进行更深入的观察。

然而,旧系统存在缺陷。由于硬件过滤器只能观察特定的几个传感器,它有时会错过发生在探测器其他区域的有趣事件。此外,一旦硬件建成,就很难更改规则。LHCb 团队决定彻底取消第一个基于硬件的过滤器。这意味着他们的系统必须处理比以前多 40 倍的数据。他们需要实时处理 32 Terabits 每秒 (Tbps) 的原始数据流,并将其过滤为最有趣的事件。如果失败了,数据将会永远丢失。

解决方案:融合工厂

团队构建了一个由 164 台服务器(计算机)组成的系统,这些服务器作为一个庞大的整体机器协同工作。以下是他们实现这一目标的方式:

1. “零拷贝”高速公路
通常情况下,当数据从网络卡移动到计算机内存,再移动到处理器时,必须经过多次复制。这就像把一个箱子从卡车搬到仓库,再从仓库搬到货架,最后再搬到展示柜一样,既费时又费力。LHCb 团队使用了“零拷贝”技术。想象一条传送带,直接从卡车穿过仓库,直达展示柜,中途无需停下来手动搬运。这使得他们能够以极快的速度移动数据,而不会拖慢计算机的速度。

2. GPU 动力源泉
他们没有使用标准的中央处理器(CPU)来进行繁重的工作,而是使用了图形处理器(GPU)。这些芯片通常出现在游戏电脑中,旨在同时处理成千上万个任务。团队意识到,重建粒子的路径与渲染复杂的 3D 游戏场景非常相似。通过将整个过滤过程放在 GPU 上,他们可以同时处理数千次碰撞。

3. 更智能的任务调度
一个挑战在于,并非所有的碰撞都是同样大小或复杂程度的。有些碰撞分析起来很快,有些则很慢。如果系统尝试逐一处理,就会陷入等待。团队开发了一个聪明的“调度器”,将事件分组成批次处理。这就像一位厨师准备餐点:他不是一次只做一个菜,而是先处理完所有的蔬菜,然后切好所有的肉,最后一起烹饪。这让 GPU 始终保持忙碌且高效。他们还使用了一个“多事件调度器”,它会观察整个批次并决定运行步骤的最佳顺序,从而确保昂贵的计算仅在真正需要的事件上进行。

4. 网络连接
为了连接这 164 台服务器,他们构建了一个使用 InfiniBand 技术(一种常用于超级计算机的技术)的定制网络。他们设计了这个网络,使每台服务器都能高效地与其他服务器通信,避免了交通拥堵(即所谓的“incast”问题)。这使得他们能够从探测器的不同部分组装出每次碰撞的碎片,并将它们发送到 GPU 进行过滤,而不会产生任何瓶颈。

结果:打破纪录

团队测试了他们的系统,发现其运行完全符合预期。

  • 速度: 他们成功实时处理了完整的 32 Tbps 输入数据。
  • 过滤: 系统应用了一个 30:1 的过滤比例。这意味着每 30 次碰撞中,只有 1 次会被保留用于进一步研究。
  • 可扩展性: 当他们用更多服务器测试系统时,系统实现了完美的扩展。该系统能够处理 LHC 的完整设计速率,即每秒 3000 万次碰撞
  • 效率: 该系统使用了 164 台服务器,配备了 328 个 GPU(每台服务器两个)。虽然总计算能力极其庞大,但设计非常高效,不需要像过去那样使用数千台机器。

论文证实,该系统能够处理物理学领域已实现的最高软件数据速率。它证明了你可以移除旧有的、僵化的硬件过滤器,并用一个更快、更智能的基于软件的系统来取代它。

为什么这很重要

这不仅仅是为了处理更多的数据,更是为了看到更多的宇宙。通过移除硬件过滤器,LHCb 实验现在可以观察探测器的整个区域来寻找有趣的事件,而不局限于旧硬件被编程监控的部分。这意味着他们可能会发现以前无法观测到的罕见粒子或新物理现象。这种“融合架构”的成功为未来粒子物理实验的构建树立了新标准,表明通过结合合适的现成技术和精妙的软件,我们可以突破科学的边界。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →