← 最新论文
⚛️ high-energy experiments

Machine Can Automatically Discover Parametric Functions to Model HEP Data

本文介绍了 SymbolFit,这是一个通过符号回归自动发现用于建模高能物理数据的参数函数的机器学习软件包,它成功复制了已知的双喷注谱函数,并在无需依赖人工直觉的情况下实现了极佳的统计拟合。

原作者: Ho Fung Tsoi, Dylan Rankin, Cecile Caillol, Miles Cranmer, Sridhara Dasu, Javier Duarte, Philip Harris, Elliot Lipeles

发布于 2026-07-23
📖 1 分钟阅读🧠 深度阅读

原作者: Ho Fung Tsoi, Dylan Rankin, Cecile Caillol, Miles Cranmer, Sridhara Dasu, Javier Duarte, Philip Harris, Elliot Lipeles

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一名试图破解谜团的侦探,但线索并非指纹或脚印,而是图表上微小的、锯齿状的凸起。这就是高能物理学家(HEP)的日常生活——在这个领域,科学家们将粒子以接近光速的速度撞击在一起,以观察宇宙是由什么构成的。当这些粒子发生碰撞时,会产生混乱的碎片喷流。为了从这种混乱中理出头绪,物理学家必须将这些碎片整理成“箱”(就像按大小对弹珠进行分类),然后通过绘制一条平滑且弯曲的线条来代表数据。这条线被称为“函数”,它就像一张地图,帮助科学家区分普通的背景噪声和真正新颖且令人兴奋的东西,比如一个隐藏的粒子。

几十年来,绘制这张地图一直是一项非常人性化、却又令人倍感挫败的工作。这就像是试图通过隔着一层厚厚的毯子去感知一个秘密物体的形状。物理学家必须对曲线应该呈现的形状进行一次大胆的猜测,画出它,检查是否吻แน่น,如果不对,就调整猜测,重新画图,然后不断重复。这种“猜想与检查”的循环可能需要耗费极长时间,而且最终得到的形状往往感觉更像是一个幸运的直觉,而非坚实的发现。但是,如果一台机器可以为你进行这些猜测呢?如果一种算法能在几秒钟内探索数百万种数学形状,从而在无需预先知道答案的情况下找到完美的拟合结果呢?这就是这篇论文所提出的重大问题,而答案可能会永远改变物理学家的工作方式。


学习如何画曲线的机器

在这项研究中,研究人员构建了一个名为 SymbolFit 的数字侦探,旨在测试计算机是否能自动发现用于模拟粒子碰撞数据的最佳数学公式。他们并没有要求人类去猜测曲线的形状,而是让机器去探索一个庞大的数学函数“森林”。这就像是给机器人一袋乐高积木(数学运算符,如加、减、乘、除和指数),并要求它搭建出一个能完美匹配一堆散落数据点的结构。机器人并不知道最终的建筑应该长什么样;它只是尝试数百万种组合,直到找到一个能完美契合数据的结果。

研究人员在来自 CMSATLAS 这两个巨大粒子探测器的真实数据上测试了这台机器,这两个探测器一直在大型强子对撞机中撞击质子。具体而言,他们研究了“双喷注谱”(dijet spectra),这类图表展示了不同能量水平下成对粒子喷注出现的频率。这些图表在建模方面极其棘手,多年来,物理学家一直依赖于两种特定的、由人工设计的公式,即所谓的 “双喷注函数”(dijet function)“UA2 函数” 来描述它们。这些公式是人类通过多年的试错才发现的。

团队设置了一个实验,进行了 560 次独立的运行,使用了 七种不同的搜索配置(有些允许机器人使用任何数学运算,有些则给它一个特定的模板来遵循)。他们想要观察两件事:机器能否自主“重新发现”那些著名的由人类创造的公式?以及它能否找到其他同样有效的公式?

结果非常成功。在 560 次运行中的 111 次 中,机器独立地“重新发现”了人类物理学家花费多年时间推导出的完全相同的公式。它仅仅通过观察数据,就找到了双喷注函数和 UA2 函数,而无需被告知要寻找什么。但这里最令人兴奋的部分在于:机器并不只是在模仿人类。它找到了 超过 1,000 个不同的候选函数,其拟合效果与著名的物理公式一样出色。事实上,那些被重新发现的人类公式仅占机器找到的成功形状中的极小一部分。

论文表明,这些由机器发现的新函数不仅仅是数学上的奇趣之作,它们还具有鲁棒性(稳健性)。研究人员使用了一种称为**不确定性建模(uncertainty modeling)**的方法,以确保机器绘制的每一条曲线都自带一个“安全余量”(即机器对其拟合程度的信心度量)。他们发现,许多这些新形状与旧形状完全不同——有些使用了不同的对数和指数组合,而另一些则使用了全新的结构——但它们都能以极高的准确度(统计得分 χ2\chi^2/NDF \approx 1)来描述粒子数据。

作者认为,这种方法可以取代过去那种靠人类猜测和微调公式的繁琐方法。与其让一位物理学家花费数周时间去精调单一的一条曲线,不如让机器瞬间生成一整个完美的拟合函数库,从而为科学家提供更多的选择,并将他们从“猜想与检查”的循环中解脱出来。虽然论文并未声称这已解决了每一个物理问题的终极方案,但它强烈暗示,对于模拟粒子数据而言,未来属于那些能够自动发现现象背后数学规律的机器。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →