← 最新论文
⚛️ high-energy experiments

MadVfold: accelerating NLO event generation and reducing negative weights with SIMD vectorization and GPUs

本文介绍了 MadVfold,这是一种基于 CUDA/C++ 的 MG5aMC“向量化折叠”实现,它利用 SIMD 和 GPU 加速在实现 NLO 事件生成 3 倍至 9 倍加速的同时,显著减少了负权重。

原作者: Andrea Valassi

发布于 2026-09-22
📖 1 分钟阅读🧠 深度阅读

原作者: Andrea Valassi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在粒子物理学的高风险世界中,大型强子对撞机(LHC)的科学家们通过碰撞质子来重现早期宇宙的条件。为了理解这些碎片,他们依赖于能够预测碰撞过程中发生情况的计算机模拟。然而,以极高的精度计算这些预测是一项极其艰巨的任务。被称为“次领头阶”(next-to-leading-order)的最准确方法,其计算速度极慢且消耗大量的计算资源。这些模拟中的一个主要障碍是“负权重”(negative weights)的出现——这是一种数学上的奇特现象,即某些模拟事件携带了一个负值。为了抵消这些负值产生的噪声并获得清晰的图像,研究人员必须生成比平时大得多的事件批次,这消耗了巨大的计算能力和时间。

为了解决这个问题,物理学家开发了一种称为“折叠”(folding)的技术。想象一下,试图通过采样单个点来估算一个复杂积分的值;这可能会产生噪声且不准确。折叠就像是对单个事件运动学变量的多个不同变体进行相同的复杂函数计算,然后取其平均值。这种方法能提供更稳定的积分估计,有助于平滑统计噪声并减少负权重的需求。虽然有效,但这种方法本身非常缓慢,因为它要求计算机针对单个事件重复执行多次相同的复杂计算。由欧洲核子研究中心(CERN)的安德里亚·瓦拉西(Andrea Valassi)提出的新方法旨在通过利用现代计算机硬件同时执行这些重复计算,从而加速这一过程。

瓦拉西的工作引入了一种名为“向量化折叠”(vectorized folding)的方法,它利用了现代图形卡和先进中央处理器的并行处理能力。这种新方法不再是要求计算机计算一个特定事件的变体,然后再计算下一个,如此循环往复,而是将数十个这样的变体组合在一起。然后,它将整个批次发送给计算机的处理器,由处理器同时计算所有这些变体。这是对传统模拟运行方式的一次重大转变,传统方式是顺序处理事件的。通过重新组织软件以利用这种并行能力,研究人员创建了一个名为 MADVFOLD 的新工具,旨在与广泛使用的 Madgraph5_aMC@NLO 模拟软件包协同工作。

重组的结果令人瞩目。在涉及电子与正电子碰撞产生底夸克的测试中,新方法显著缩短了生成模拟事件所需的时间。当使用现代数据中心中的先进处理器时,向量化折叠技术使计算速度比标准方法快了大约六到九倍。当计算任务被卸载到图形处理器(GPU)时,加速效果更加显著,达到了原始方法的近十倍。这些增益并非通过改变底层物理学实现的,而是通过改变计算机执行数学运算的方式,使其能够更高效地处理折叠中的繁重任务。

该研究还探讨了这种并行方法是否可以应用于完全不使用折叠技术的事件生成。即使是在这种“未折叠”的情景下(即目标仅仅是加速标准模拟),新软件也实现了三倍的速度提升。这表明,为支持折叠而进行的架构变革具有更广泛的益处,使整个模拟流程都变得更加高效。这项工作是利用一种新颖的过程开发的,研究人员在编写和测试代码的过程中大量依赖大语言模型辅助,这种方法使得项目能够在短短约六周内从概念转化为可运行的软件。

尽管取得了令人印象深刻的加速效果,论文指出折叠仍然是一种计算成本高昂的技术。即使有了这种硬件加速,运行带有折叠的模拟仍然比运行不带折叠的模拟耗时得多。然而,这种权衡通常是必要的,因为折叠减少了负权重事件的数量,进而减少了达到统计显著性结果所需的总事件数。通过使折叠过程本身变得更快,新方法使得这种必要的权衡对于未来的实验(包括即将到来的高亮度 LHC 计划)变得更加可行。研究结论认为,虽然该软件已准备好进行进一步的测试和完善,但它代表了在使高精度粒子物理模拟能够应对未来几年预期的海量数据集方面迈出的重要一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →