在欧洲的心脏地带,大型强子对撞机将质子以接近光速的速度撞击在一起,产生出混乱的新粒子流,物理学家必须从中进行筛选,以理解自然界的根本规律。为了从这些海量数据中理出头绪,研究人员依赖于强大的计算机模型,这些模型通常被称为基础模型(foundation models),它们经过训练以识别模式并区分不同类型的粒子碰撞。在教导这些模型时,一个主要的挑战是:它们需要学习当粒子碰撞从略微不同的角度观察,或者探测器记录方式发生细微变化时,哪些特征是保持不变的。传统上,科学家试图通过人工扭曲数据来教导这一点,即为每个事件创建略微改变的副本,以此向模型展示尽管存在噪声,底层的物理特性依然保持不变。然而,在粒子物理学这个高风险的世界里,这些人工扭曲是具有风险的;如果计算机模拟改变了粒子的路径,使其违反了物理定律,模型就会学到错误的经验,从而在面对真实数据时变得不可靠。
宾夕法尼亚大学的一个研究小组提出了一种不同的教学方法,这种方法完全避免了人工改变。他们不再发明虚假的粒子碰撞变体,而是简单地寻找两个恰好看起来非常相似的真实且不同的碰撞。他们使用了一种名为“能量移动者距离”(energy mover's distance)的数学工具,该工具可以精确计算出将一个碰撞中的能量重新排列以匹配另一个碰撞布局所需的精确功量。如果所需的功量很小,这两个事件在物理世界中就被视为近邻。通过将这些天然相似的事件配对在一起,研究人员可以训练他们的模型,使其识别出这两个不同的真实发生事件共享相同的核心身份,而无需破坏或扭曲支配数据的物理定律。
研究人员利用一个巨大的模拟粒子喷注(particle jets)数据集测试了这个想法,这些喷注是夸克或胶子在碰撞过程中被撞松时产生的粒子喷射。他们专注于两种常见的喷注类型,即轻夸克喷注和胶子喷注,并使用这种新的配对方法来训练计算机模型。系统并没有将单个喷注扭曲成一个虚假版本,而是选取两个在能量排列上天然接近的独立喷注,并要求模型将它们视为同一种事物。模型学会了忽略这些真实事件之间的微小随机差异,转而关注定义它们的深层结构。当研究人员检查结果时,发现该模型建立了一个清晰的心理地图,即使对于训练期间从未见过的喷注类型,不同类型的喷注也能整齐地归类在一起。
为了验证这种新方法是否真的适用于现实世界的问题,团队要求该模型扮演侦探的角色,在常见的背景噪声中寻找罕见、异常的粒子。这是对撞机面临的一项关键任务,因为寻找新粒子往往意味着要在数百万个普通事件中发现一个奇特的事件。使用自然配对方法训练的模型证明了其在发现这些稀有信号方面与采用传统人工扭曲方法的模型一样出色,在某些情况下甚至更好。结果表明,通过依赖真实数据中存在的天然相似性,而非手工制作的技巧,模型学到了更稳健、更准确的粒子物理学理解。这种方法表明,训练这些强大工具的未来可能不在于创造新数据,而在于发现我们所收集的大量真实数据中已经存在的隐藏联系。
技术摘要:用于大型强子对撞机(LHC)自监督预训练的能量移动距离相似性配对
问题陈述
自监督学习(SSL)已成为为高能物理(HEP)特别是大型强子对撞机(LHC)数据训练基础模型的基石。标准的 SSL 工作流依赖于数据增强来创建事件的多种视图,从而鼓励模型学习对特定畸变或对称性的不变性。然而,在 HEP 中,与计算机视觉不同,应用任意增强受到严格物理定律和探测器限制的约束。手工设计的增强可能会破坏物理对称性或违反事件保真度,或者生成额外的模拟事件变体在计算上是非常昂贵的。因此,在保持物理特性同时提供足够的学习变化量方面,选择一套鲁棒的增强方法面临着重大挑战。
方法论
作者提出了一种替代手工设计增强的数据驱动方案:基于能量移动距离(Energy Mover's Distance, EMD)的相似性配对。该方法不是通过扭曲单个事件来创建增强视图,而是将两个在能量分布几何特征上相似的不同真实碰撞事件进行配对。
- EMD 配对: 能量移动距离是一种最优传输度量,它量化了将一个事件的能量分布转化为另一个事件所需的“功”。较小的 EMD 值表示两个不同的事件在几何上是相似的,实际上代表了“在波动情况下的同一事件”。通过配对具有低 EMD 值的事件,模型可以学习对真实的物理波动保持不变性,而不会改变事件的物理内容或引入人工畸变。
- 预训练框架: 作者将这种配对策略集成到 jBOT 框架中,这是一个基于 iBOT 架构的自蒸馏方法。在此设置下:
- 根据 EMD 相似性对两个不同的喷注(jets)进行配对。
- 采用教师-学生编码器架构。学生处理掩码后的喷注,而教师处理完整的喷注。
- 目标是最小化教师和学生输出分布在粒子级和喷注级上的交叉熵。
- 该配对过程取代了增强步骤,使得该方法对于任何需要视图对的特定 SSL 算法都是通用的。
实验设置
该方法使用包含 13 TeV 质子-质子碰撞喷注的 JetNet 数据集进行了评估。该数据集包含五个类别:轻夸克 (q)、胶子 (g)、W 玻色子、Z 玻色子和顶夸克 (t)。
- 预训练: 模型仅在 QCD 喷注(q 和 g)上使用 Transformer 编码器进行预训练。
- 配对方案: 探索了三种配对模式:
- 同类(Same-class): q 与 q 配对,g 与 g 配对。
- 异类(Different-class): q 与 g 配对,反之亦然。
- 随机(Random): 无类别约束,仅基于 EMD 相似性进行配对。
- 下游任务: 预训练的嵌入被用于探测异常检测(即识别背景中的 W、Z 和 t 喷注),且无需微调,使用的是 k-最近邻(kNN)、余弦相似度和马氏距离。
关键结果
- 嵌入结构: t-SNE 可视化表明,EMD 配对方法产生的嵌入具有清晰的聚类结构。值得注意的是,模型成功分离了预训练期间未使用的喷注类别(W、Z、t),这表明学习到的表示捕捉到了高层语义。与基准的基于增强的方法相比,QCD 喷注(q 和 g)形成了更密集、更局部的簇。
- 异常检测性能:
- 在各种配对方案中,随机配对模式(不受类别约束)产生了最高的性能(组合信号 AUC 为 0.8188±0.0076),这在统计上与同类模式(0.8142±0.0090)是兼容的。这表明移除类别约束可以扩大不变性学习的空间。
- 与基准对比: 与基于增强的 jBOT 基准相比,EMD 配对方法取得了相当或更优越的性能。具体而言,使用余弦相似度评分时,EMD 配对模型在组合信号($0.8309对比0.8269)以及W信号类别上实现了更高的AUC,而Z和t$ 类别根据度量标准显示出相当或略低的性能。
意义与主张
论文声称,通过 EMD 进行相似性配对是自监督预训练中手工设计增强的一种可行且数据驱动的替代方案。其主要意义在于能够:
- 保持物理特性: 通过避免人工畸变,维持物理定律和探测器约束的完整性。
- 降低计算成本: 消除生成额外模拟事件变体的需求。
- 改进表示: 生成对物理相似事件之间的波动不敏感的语义喷注嵌入,从而获得与传统基于增强的方法相匹配甚至更优的下游判别能力。
作者得出结论,该技术对于训练基础模型是有效的,并建议未来将其应用于其他数据类型,如基于图像的探测器数据,尽管他们并未超出此范围详细阐述具体的实现细节。
每周获取最佳 high-energy experiments 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。