← 最新论文
⚛️ high-energy experiments

Efficient binned profile likelihood minimization for precision measurements with RABBIT

本文介绍了 RABBIT,这是一个利用 TensorFlow 2 的可微编程和即时编译技术构建的 Python 框架,旨在为精密 LHC 测量实现快速、稳健且可扩展的分箱剖面似然最小化,其在高维场景下的表现优于现有工具。

原作者: David Walter, Josh Bendavid, Kenneth Long

发布于 2026-08-28
📖 1 分钟阅读🧠 深度阅读

原作者: David Walter, Josh Bendavid, Kenneth Long

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在大型强子对撞机(LHC)的高能物理实验中,科学家们并非仅仅寻找探测器中出现的单个粒子。相反,他们必须通过根据能量和其他特性将碎片分类到成千上万个微小的类别或“分箱”(bins)中,从而重建数十亿次碰撞的故事。为了从这些海量数据中理出头绪,研究人员构建了复杂的统计模型,用以预测如果其理论正确,数据应当呈现出的样子。这些模型必须考虑到实验中不可避免的“噪声”,例如探测器性能的轻微变化或环境因素,这些因素被视为被称为“干扰参数”(nuisance parameters)的可调节旋钮。其目标是通过转动模型的旋钮,使预测结果尽可能地与观测到的数据相匹配,这一过程被称为“拟合”(fit)。随着对撞机收集的数据越来越多,分箱的数量和这些调节旋钮的数量都增长到了数千个,这使得寻找完美匹配的数学任务对于现有的计算机工具而言变得日益困难且耗时。

为了解决这一日益严重的瓶颈问题,一个研究小组开发了一种名为 RABBIT 的新软件框架,其全称为“快速自动分箱推理工具”(Rapid Automatic Bin-Based Inference Tool)。该系统旨在处理现代粒子物理测量中的大规模数据,特别是涉及高亮度 LHC(High-Luminosity LHC)的情况,届时数据量将远大于目前机器所产生的数据量。研究人员利用一种现代编程方法构建了 RABBIT,将整个统计模型视为一个单一且连续的计算流。这使得计算机能够精确计算出当任何单个旋钮被转动时,最终结果会如何变化,而旧的方法通常只能进行近似计算或难以快速计算此类变化。通过将这种精确计算与允许软件在标准处理器和专用图形芯片上高效运行的技术相结合,该团队创建了一个能够处理数十万个分箱和数千个变量的模型,且处理速度仅为现有成熟工具的一小部分时间。

研究人员使用模拟真实粒子物理实验复杂性的合成模型对 RABBIT 进行了测试,通过生成具有已知属性的伪数据来观察软件恢复正确答案的能力。在这些测试中,他们将 RABBIT 与目前物理学界使用的标准工具进行了对比。当模型较为简单时,所有工具的表现都相似,在数秒内即可完成计算。然而,当复杂度增加到包含 100,000 个分箱和超过 1,000 个调节旋钮时,旧工具开始表现挣扎,往往无法在合理的时间内找到解,或者耗尽内存。相比之下,RABBIT 依然能够平稳运行,完成了其他工具需要超过十分钟才能完成的拟合,且在不到一分钟内便完成了任务,并成功解决了导致其他软件完全崩溃的、拥有 100,000 个分箱的模型。该软件之所以实现这种速度,是利用了一种特定的数学策略,即避免计算所有变量之间完整的、庞大的关系矩阵,而是专注于通往解的最直接路径。

除了纯粹的速度提升外,这个新框架还为处理数据提供了一种更灵活的方式。它允许科学家将物理量(例如粒子相互作用的截面)定义为模型输出的直接变换。这意味着一旦模型拟合到数据,软件就可以自动计算最终的物理结果及其不确定性,而无需重新运行整个复杂的拟合过程。研究人员还展示了该工具可以处理处理系统误差的不同方式,包括通过将变化视为对称或加性的方法来简化数学运算,这在不牺牲准确性的情况下进一步提高了处理速度。团队通过证明当 RABBIT 和当前标准软件应用于同一个模型时,两者产生的统计值完全一致,验证了其结果,从而证实了这种速度的提升并非以牺牲正确性为代价。

这项工作的意义对于粒子物理学的未来至关重要。高亮度 LHC 将产生如此庞大的数据集,以至于当前一代的分析工具可能无法高效处理这些数据,从而可能限制未来测量的精度。RABBIT 为分析这些大规模数据集提供了路径,使科学家能够以前所未有的细节度来测量物理可观测量。该框架已经应用于现实世界的测量中,例如 W 玻色子质量的测定,作者指出,其扩展到处理数百万个数据点的能力,对于充分利用对撞机及其后续数据至关重要。通过使复杂高维数据的统计分析变得更快、更鲁棒,这一工具确保了科学界能够从最具挑战性的实验中持续提取出最精确的答案。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →