← 最新论文
⚛️ high-energy experiments

Similarity Pairing with Energy Mover's Distance for Self-Supervised Pre-Training at the LHC

本文介绍了一种针对大型强子对撞机的、数据驱动且无需增强的自监督预训练方法,该方法通过基于能量移动距离(Energy Mover's Distance)相似性对不同事件进行配对以学习不变表示,在保持事件保真度的同时,实现了与传统的基于增强的基准模型相当或更优的下游性能。

原作者: Ho Fung Tsoi, Dylan Rankin

发布于 2026-09-17
📖 1 分钟阅读🧠 深度阅读

原作者: Ho Fung Tsoi, Dylan Rankin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在欧洲的心脏地带,大型强子对撞机将质子以接近光速的速度撞击在一起,产生出混乱的新粒子流,物理学家必须从中进行筛选,以理解自然界的根本规律。为了从这些海量数据中理出头绪,研究人员依赖于强大的计算机模型,这些模型通常被称为基础模型(foundation models),它们经过训练以识别模式并区分不同类型的粒子碰撞。在教导这些模型时,一个主要的挑战是:它们需要学习当粒子碰撞从略微不同的角度观察,或者探测器记录方式发生细微变化时,哪些特征是保持不变的。传统上,科学家试图通过人工扭曲数据来教导这一点,即为每个事件创建略微改变的副本,以此向模型展示尽管存在噪声,底层的物理特性依然保持不变。然而,在粒子物理学这个高风险的世界里,这些人工扭曲是具有风险的;如果计算机模拟改变了粒子的路径,使其违反了物理定律,模型就会学到错误的经验,从而在面对真实数据时变得不可靠。

宾夕法尼亚大学的一个研究小组提出了一种不同的教学方法,这种方法完全避免了人工改变。他们不再发明虚假的粒子碰撞变体,而是简单地寻找两个恰好看起来非常相似的真实且不同的碰撞。他们使用了一种名为“能量移动者距离”(energy mover's distance)的数学工具,该工具可以精确计算出将一个碰撞中的能量重新排列以匹配另一个碰撞布局所需的精确功量。如果所需的功量很小,这两个事件在物理世界中就被视为近邻。通过将这些天然相似的事件配对在一起,研究人员可以训练他们的模型,使其识别出这两个不同的真实发生事件共享相同的核心身份,而无需破坏或扭曲支配数据的物理定律。

研究人员利用一个巨大的模拟粒子喷注(particle jets)数据集测试了这个想法,这些喷注是夸克或胶子在碰撞过程中被撞松时产生的粒子喷射。他们专注于两种常见的喷注类型,即轻夸克喷注和胶子喷注,并使用这种新的配对方法来训练计算机模型。系统并没有将单个喷注扭曲成一个虚假版本,而是选取两个在能量排列上天然接近的独立喷注,并要求模型将它们视为同一种事物。模型学会了忽略这些真实事件之间的微小随机差异,转而关注定义它们的深层结构。当研究人员检查结果时,发现该模型建立了一个清晰的心理地图,即使对于训练期间从未见过的喷注类型,不同类型的喷注也能整齐地归类在一起。

为了验证这种新方法是否真的适用于现实世界的问题,团队要求该模型扮演侦探的角色,在常见的背景噪声中寻找罕见、异常的粒子。这是对撞机面临的一项关键任务,因为寻找新粒子往往意味着要在数百万个普通事件中发现一个奇特的事件。使用自然配对方法训练的模型证明了其在发现这些稀有信号方面与采用传统人工扭曲方法的模型一样出色,在某些情况下甚至更好。结果表明,通过依赖真实数据中存在的天然相似性,而非手工制作的技巧,模型学到了更稳健、更准确的粒子物理学理解。这种方法表明,训练这些强大工具的未来可能不在于创造新数据,而在于发现我们所收集的大量真实数据中已经存在的隐藏联系。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →