← 最新论文
⚛️ phenomenology

Prompting Particle Physics: Tokenized Multi-modal Foundation Models for Combinatorially Many Tasks

本文介绍了一种标记化的多模态基础模型,该模型将各种对撞机重建与模拟任务统一到一个框架中,通过灵活的基于提示的模态映射实现多样化中间物理对象的生成,同时达到了最先进的性能和 Geant4 级别的保真度。

原作者: Nilotpal Kakati, Daniel Murnane, Baran Hashemi, Samuel Klein, Jeffrey Krupa, Eilam Gross, Lukas Heinrich, Michael Kagan

发布于 2026-09-29
📖 1 分钟阅读🧠 深度阅读

原作者: Nilotpal Kakati, Daniel Murnane, Baran Hashemi, Samuel Klein, Jeffrey Krupa, Eilam Gross, Lukas Heinrich, Michael Kagan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在大型强子对撞机的心脏地带——这台埋藏在瑞士与法国边境深处的机器中,科学家们正让质子以接近光速的速度相互碰撞。当这些粒子发生碰撞时,它们会破碎成大量新的、通常是转瞬即逝的亚原子粒子。为了理解宇宙的基本定律,物理学家必须重建那短短一瞬间所发生的一切。他们从原始数据开始:来自传感器的微弱电信号以及大型探测器中的能量沉积。通过这些零散的线索,他们必须构建出碰撞的完整图像,识别带电粒子的路径,将能量分组为簇,并最终拼凑出从碰撞中飞出的原始粒子。几十年来,这种重建过程一直是一个由专门的计算机程序组成的漫长且曲折的链条。链条中的每个程序都是单一任务的专家,经过人工调优以处理一个特定的步骤,从追踪粒子的路径到测量其能量。虽然这种方法行之有效,但它非常僵化、缓慢,并且在数据从一个专门工具传递到下一个工具的过程中,往往会丢失信息。

现在,一组研究人员提出了一种看待这个问题的新方法,即不再将整个重建过程视为一系列独立的工具,而是将其视为一场单一且灵活的对话。他们探究是否可以通过一个计算机模型来同时学习执行许多这些步骤,并在不同类型的数据之间流畅切换。他们并没有为每一项工作构建一个新的算法,而是教会了一个人工智能一种通用的粒子物理语言。通过将每一件信息——无论是原始传感器读数、粒子的路径,还是高层级的能量测量值——都转换为一份简单的离散符号列表,他们创建了一种共享的词汇表。在这个新系统中,可以要求模型根据原始传感器数据生成粒子列表,或者根据粒子列表模拟传感器所看到的景象。该模型不仅仅是在猜测最终答案;它还会生成中间步骤,产生物理学家可以像使用传统方法那样进行检查和验证的轨迹(tracks)和簇(clusters)。

研究人员在海量的模拟粒子碰撞数据集上训练了两个版本的模型。其中一个版本被称为 nanoHEP,它的工作方式就像一个讲故事的人,逐个符号地生成输出,利用前一个符号来决定下一个符号。另一个版本 HEP4M 则更像是一个画家,在瞥一眼的同时就能同时预测出给定对象的所有符号。他们在极其多样化的任务上测试了这些模型。总共,他们探索了超过 1,300 种不同的输入与输出组合。例如,他们要求模型根据轨迹和能量簇来预测真实的粒子(这一任务被称为粒子流),或者根据真实粒子来预测原始传感器信号(这一任务被称为探测器模拟)。他们甚至测试了模型从未见过的组合,比如同时输入四种不同类型的数据,看它是否能结合这些数据做出更好的预测。

结果表明,这种统一的方法不仅可行,而且非常有效。自回归模型(即逐步生成数据的模型)表现得尤为出色。在负责从探测器数据重建粒子的任务中,它在重建喷注动量(jet momentum)的解析度和分类器得分方面,超越了目前最先进的专门算法;而单任务模型 HEP4M 则实现了最接近于单位值的最佳校准响应。更重要的是,它生成的物体——例如带电粒子的路径和能量簇的形状——极其逼真,以至于很难与现有的最精细物理模拟所产生的数据区分开来,尽管它们与真实情况仍有细微差别。该模型如此完美地学习了不同类型数据之间的复杂关系,以至于它能够泛化到新任务中。当被输入一种它在训练期间从未见过的四种输入类型的组合时,它产生的预测结果至少与它在所有已训练组合上取得的结果一样准确,甚至达到了匹配或超越专门为这些单项任务训练的模型的效果。这表明,该模型学习到了粒子物理学背后深刻的内在逻辑,而不仅仅是记忆特定的模式。

然而,这项研究也强调了一种权衡。生成数据的逐步生成模型虽然更准确,但运行时间更长;而同时预测所有内容的模型虽然速度更快,但在捕捉数据精细细节方面略逊一筹。研究人员发现,最佳方法取决于实验的具体需求。对于需要最高保真度以符合真实物理规律的任务,这种较慢的、逐步生成的模型更为优越。对于速度至关重要的任务,快速的模型则提供了一个极具吸引力的选择。至关重要的是,研究人员证明了这一个模型就可以处理整个重建与模拟的任务谱系,从最原始的传感器数据到最高层级的物理特征,而无需为每一项新工作重新进行训练。

这项工作代表了粒子物理数据处理方式的一次重大转变。通过从一系列专门的、孤立的工具转向一个单一的、多用途的基础模型,科学家们有望简化整个分析流程。由于该模型能够生成具有物理可解释性的中间对象,它因此不再是一个“黑箱”;物理学家仍然可以观察它生成的轨迹和簇,以确保其符合物理逻辑。尽管该模型仍面临挑战,特别是在生成具有完美精度的原始传感器数据方面,但这种方法的成功表明,未来可能会出现一种单一且全能的智能,帮助我们揭开隐藏在亚原子世界碰撞中的复杂故事。研究人员已经公开了他们的代码和数据,邀请更广泛的科学界基于这种全新的观测宇宙的方式开展工作。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →