← 最新论文
💻 computer science

Vision Transformers for End-to-End Quark-Gluon Jet Classification from Calorimeter Images

本文通过一项系统性评估表明,视觉 Transformer (ViT) 及混合架构通过有效捕捉长程空间相关性,在利用量热计图像对夸克和胶子引发的喷注进行分类方面优于传统的卷积神经网络,从而为使用公开对撞机数据的端到端深度学习在高能物理领域的应用建立了新的性能基准。

原作者: Md Abrar Jahin, Shahriar Soudeep, Arian Rahman Aditta, M. F. Mridha, Nafiz Fahad, Md. Jakir Hossen

发布于 2026-08-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Md Abrar Jahin, Shahriar Soudeep, Arian Rahman Aditta, M. F. Mridha, Nafiz Fahad, Md. Jakir Hossen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在大型强子对撞机巨大的环形结构深处,粒子以接近光速的速度相互碰撞,产生出混乱的碎片喷流,物理学家必须从中进行分类,以理解宇宙的基本规律。当质子发生碰撞时,它们通常会产生两种截然不同的粒子喷流,称为“喷注”(jets):一种源自夸克(quark),另一种源自胶子(gluon)。虽然对于探测器而言,两者看起来都是能量构成的混乱圆锥体,但它们有着本质的区别。夸克是质子和中子的基本组成部分,而胶子则是将它们粘合在一起的“胶水”。胶子携带更强的“色荷”(color charge)——这是强核力的一个属性——这导致它们会分解成比夸克产生的更宽、更拥挤的粒子喷流,而夸克的喷流则更为紧凑且干净。区分这两者对科学家至关重要。如果他们无法将它们区分开,就可能会错过隐藏在背景噪声中的新的、未知的物理学微弱信号,或者可能将一个普通的事件误认为是某种非凡的发现。几十年来,物理学家一直依赖复杂的数学规则来分离这些喷注,但由于模式过于复杂且数据量过于庞大,人类设计的规则往往显得力不从心。

现在,一组研究人员转向了一种不同类型的智能来解决这个问题:模仿人类大脑的人工智能。他们并没有试图编写描述夸克与胶子之间差异的方程,而是教会了计算机观察粒子碰撞的原始图像,并让其自行学习其中的差异。他们使用了来自欧洲核子研究中心(CERN)CMS实验的数据,该实验记录了粒子穿过探测器各层时留下的能量沉积。这些沉积被转化为数字图像,其中较亮的点代表更多的能量。研究人员测试了一种名为“视觉Transformer”(Vision Transformer)的新型人工智能。与以往通过逐一扫描图像中微小局部区域的传统计算机视觉工具不同,视觉Transformer可以同时观察整幅图像。它能瞬间捕捉到图像一角的一个亮点与另一侧一个暗点之间的关联,从而在一次注视中捕捉到喷注的全局形状和结构。

这项研究涉及向计算机输入数百万张模拟的喷注图像,其中一半显示夸克喷注,另一半显示胶子喷注。这些图像是由三种不同类型的探测器数据构建而成的:带电粒子留下的轨迹、电磁量热计测得的能量,以及强子量热计测得的能量。通过将这些数据组合成一张多层级的全景图,研究人员为人工智能提供了观察事件的全貌。随后,他们将这些新型视觉Transformer与该领域长期使用的传统工具(这些工具依赖于扫描微小的局部区域)进行了对比。结果清晰且一致:视觉Transformer,尤其是当与其他先进架构结合使用时,在区分这两类喷注方面表现得显著更好。它们实现了更高的准确率,并且在正确识别喷注的同时减少了错误,这种平衡对于科学发现至关重要。

研究人员发现,能够同时观察全局的能力赋予了新模型明显的优势。夸克喷注和胶子喷注的区别在于微妙的远程模式;能量如何在整个探测器中扩散,往往比单个像素的强度更具指示意义。而专注于局部细节的旧工具则难以连接这些遥远的关联点。然而,视觉Transformer却在全局语境中表现出色,成功地将胶子喷注那复杂且弥散的结构与更为紧凑的夸克喷注区分开来。研究还探索了将这些新模型与旧模型混合的不同方式,从而创建了结合两者优点的混合系统。这些混合模型表现得更佳,这表明粒子物理分析的未来可能在于将传统方法的局部精确性与现代Transformer模型的广阔语境理解力相结合。

尽管这些发现令人振奋,但研究人员谨慎地指出,他们的工作是基于模拟数据完成的,即一种高度精确的、模拟探测器行为的计算机模型。下一步是在对撞机的真实数据上测试这些模型,以观察它们在真实实验中混乱且不可预测的环境下是否依然有效。此外,这些强大的模型需要大量的计算能力才能运行,这可能会成为未来进行实时分析的一个障碍。尽管存在这些局限性,该研究仍为机器学习如何应用于粒子物理学建立了一个新的基准。它表明,通过让计算机将整个事件视为一个整体而非仅仅是其组成部分,科学家们可以解锁对亚原子世界的更深层次理解,从而有可能揭示那些一直隐藏在显而易见之处的新物理学。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →