← 最新论文
⚛️ phenomenology

Masked Particle Modeling on Sets: Towards Self-Supervised High Energy Physics Foundation Models

本文介绍了掩码粒子建模(Masked Particle Modeling, MPM),这是一种自监督预训练框架,通过利用矢量量化重建被掩码的粒子,学习高能物理中无序粒子集的置换不变表示,并证明了其作为基础模型在喷注分类和领域迁移等多种下游任务中的有效性。

原作者: Tobias Golling, Lukas Heinrich, Michael Kagan, Samuel Klein, Matthew Leigh, Margarita Osadchy, John Andrew Raine

发布于 2026-08-27
📖 1 分钟阅读🧠 深度阅读

原作者: Tobias Golling, Lukas Heinrich, Michael Kagan, Samuel Klein, Matthew Leigh, Margarita Osadchy, John Andrew Raine

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

高能物理学是研究宇宙最基本构建块的学科,通过将粒子以惊人的速度碰撞在一起,并观察碰撞后飞出的物质来进行研究。这些实验中的探测器看到的并不是单一、整洁的对象;相反,它们记录的是由成千上万个微小碎片(称为粒子)组成的混乱、无序的集合,这些碎片从碰撞中喷涌而出。几十年来,科学家一直利用人工智能来解析这些数据,但这些计算机程序通常像背诵闪卡的学生一样进行训练:它们被喂入大量的标注示例,并被告知要寻找什么。这种方法对于特定任务效果很好,但效率很低。它需要针对每个新问题提供海量的标注数据,并且在数据发生轻微变化时(例如从计算机模拟转向真实的实验结果时)表现挣扎。该领域目前正转向一种不同类型的智能,即一种通过自主观察世界而非依赖老师指点每一个细节来学习的智能。这就是基础模型(foundation models)的领域,这类系统通过从巨大的无标注数据集中学习通用模式,以便稍后能够适应许多不同的任务。

一个研究团队已经朝着构建专门用于高能物理的基础模型迈出了重要一步。他们开发了一种名为“掩码粒子建模”(masked particle modeling)的新方法,这种方法通过玩一场“填空”游戏来教会计算机理解粒子碰撞的结构。想象一下,一个粒子喷流就像房间里散落的一群人。在这种方法中,计算机看到的是房间里有几个人被帘子遮住了。它的任务是仅根据它仍然能看到的那些人的行为和位置,来猜出那些隐藏的人是谁以及他们在做什么。为了实现这一点,研究人员必须解决两个主要问题。首先,与句子中的单词具有固定顺序不同,喷流中的粒子没有特定的序列;它们是一个杂乱的集合。其次,这些粒子的属性(如速度和方向)是连续的数值,而不是字典中离散的单词。研究人员创建了一个系统,将这些连续的数值转换为一组离散的“标记”(tokens),类似于数字图像被分解为像素,从而让计算机能够将粒子视为它可以学习预测的词汇。

研究人员使用一个包含一亿个模拟粒子喷流(代表十种不同类型的粒子碰撞)的海量数据集测试了这种方法。他们训练模型隐藏喷流中的一部分粒子,然后预测缺失粒子的身份。为此,他们使用了一个专门的工具,将粒子复杂的连续特征转化为更简单的离散代码。模型学会了理解可见粒子之间的关系,以重建隐藏的粒子。结果表明,这种自学模型培养了对粒子物理学的深度通用理解。当研究人员在它从未见过的任务上进行测试时(例如识别特定类型的喷流或区分不同的粒子来源),该模型的表现非常出色。在标注数据量较少的情况下,这种表现尤为显著。在这些情况下,经过预训练的模型在处理新任务时的表现远优于从头开始训练的模型,这证明了最初的“填空”练习确实教会了它有用且可迁移的技能。

研究还探讨了这种知识在不同类型数据之间迁移的效果。研究人员在一个模拟数据集上训练模型,然后尝试将其应用于由不同模拟设置生成的另一个数据集,这模拟了从理论转向现实实验的挑战。预训练模型能够快速适应这种新环境,即使在只有极少量新标注数据的情况下也能保持高性能。这表明模型学习到的是基本的物理模式,而不仅仅是记住了特定模拟的特性。此外,研究人员还证明了该模型可以用于“弱监督”场景,即数据是混乱且标签是不完美的。通过利用从初始预训练中获得的知识,模型仍能高精度地分辨信号与背景噪声,这对于缺乏完美数据的现实实验来说是一项至关重要的能力。

研究结果表明,这种方法为分析高能物理数据提供了一种强大的新途径。通过从大量的无标注数据中学习,这些模型可以减少对昂贵且完美标注的模拟数据的依赖。研究人员发现,当他们将粒子视为无序集合,并使用一种侧重于对缺失粒子身份进行分类而非仅仅猜测其精确数值的特定预测损失函数时,模型的泛化能力最强。他们还发现,粒子的呈现顺序仅在预测阶段起作用,而在核心学习阶段并不重要,从而保留了数据的自然对称性。虽然这项工作是使用模拟数据进行的,但作者认为,这种方法最终可以被直接应用于真实的实验数据,使科学家能够直接从粒子对撞机的原始输出中学习,而无需先将其转化为模拟过程。这将代表物理数据处理方式的一次重大转变——从针对特定任务的训练,转向一种更稳健、更通用的对亚原子世界的理解。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →