← Nieuwste papers
⚛️ high-energy experiments

Similarity Pairing with Energy Mover's Distance for Self-Supervised Pre-Training at the LHC

Dit artikel introduceert een datagedreven, augmentatievrije zelfgesuperviseerde pre-training methode voor de Large Hadron Collider die verschillende gebeurtenissen koppelt op basis van hun Energy Mover's Distance gelijkenis om invariante representaties te leren, waarbij een downstream prestatie wordt bereikt die vergelijkbaar met of beter dan traditionele augmentatiegebaseerde baselines is terwijl de getrouwheid van de gebeurtenis behouden blijft.

Oorspronkelijke auteurs: Ho Fung Tsoi, Dylan Rankin

Gepubliceerd 2026-09-17
📖 4 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Ho Fung Tsoi, Dylan Rankin

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

In het hart van Europa laat de Large Hadron Collider protonen tegen elkaar botsen met bijna de snelheid van het licht, waarbij een chaotische stortvloed van nieuwe deeltjes ontstaat die natuurkundigen moeten analyseren om de fundamentele wetten van de natuur te begrijpen. Om orde te scheppen in deze overvloed aan gegevens, vertrouwen onderzoekers op krachtige computermodellen, vaak foundation models genoemd, die getraind zijn om patronen te herkennen en onderscheid te maken tussen verschillende soorten deeltjesbotsingen. Een grote uitdaging bij het trainen van deze modellen is dat ze moeten leren wat hetzelfde blijft wanneer een deeltjesbotsing vanuit een iets andere hoek wordt bekeken of met kleine variaties in de manier waarop de detector het registreert. Traditioneel hebben wetenschappers geprobeerd dit te leren door de gegevens kunstmatig te vervormen, waarbij licht gewijzigde kopieën van elk evenement worden gemaakt om het model te laten zien dat de onderliggende fysica onveranderd blijft, ondanks de ruis. Echter, in de hooggestelde wereld van de deeltjesfysica zijn deze kunstmatige vervormingen riskant; als een computersimulatie het pad van een deeltje verandert op een manier die de natuurwetten schendt, leert het model de verkeerde lessen, waardoor het onbetrouwbaar wordt wanneer het geconfronteerd wordt met echte data.

Een team onderzoekers aan de Universiteit van Pennsylvania heeft een andere manier voorgesteld om deze modellen te onderwijzen, een methode die kunstmatige veranderingen volledig vermijdt. In plaats van nepvariaties van een deeltjesbotsing te verzinnen, zoeken zij simpelweg naar twee echte, verschillende botsingen die toevallig erg veel op elkaar lijken. Ze gebruiken een wiskundig hulpmiddel genaamd de 'energy mover's distance', die precies berekent hoeveel werk het zou kosten om de energie in de ene botsing te herschikken zodat deze overeenkomt met de lay-out van de andere. Als de benodigde arbeid klein is, worden de twee gebeurtenissen beschouwd als nabije buren in de wereld van de fysica. Door deze natuurlijk gelijkaardige gebeurtenissen aan elkaar te koppelen, kunnen de onderzoekers hun model trainen om te herkennen dat deze twee verschillende werkelijke gebeurtenissen dezelfde kernidentiteit delen, zonder ooit de natuurwetten die de data beheersen te breken of te buigen.

De onderzoekers testten dit idee met behulp van een enorme dataset van gesimuleerde deeltjesjets, wat sprays van deeltjes zijn die ontstaan wanneer quarks of gluonen worden losgeslagen tijdens een botsing. Ze richtten zich op twee veelvoorkomende typen jets, bekend als light quark jets en gluon jets, en gebruikten hun nieuwe koppelingsmethode om een computermodel te trainen. In plaats van één jet te nemen en deze in een nepversie te draaien, nam het systeem twee aparte jets die van nature dicht bij elkaar lagen in hun energie-arrangement en vroeg het het model om de twee als hetzelfde te behandelen. Het model leerde de kleine, willekeurige verschillen tussen deze echte gebeurtenissen te negeren en zich te concentreren op de diepere structuur die hen definieert. Wanneer de onderzoekers de resultaten controleerden, had het model een heldere mentale kaart ontwikkeld waarbij verschillende typen jets netjes bij elkaar gegroepeerd waren, zelfs voor typen jets die het tijdens de training nog nooit had gezien.

Om te zien of deze nieuwe methode ook echt werkte voor problemen uit de echte wereld, vroegen het team het model om als een detective op te treden, zoekend naar zeldzame, ongewone deeltjes die verborgen liggen tussen de algemene achtergrondruis. Dit is een cruciale taak bij de collider, waar het vinden van een nieuw deeltje vaak betekent dat men een enkel vreemd evenement moet spotten in een zee van miljoenen gewone gebeurtenissen. Het model dat getraind was met de natuurlijke koppelingsmethode bleek net zo goed, en in sommige gevallen zelfs iets beter, in het opsporen van deze zeldzame signalen dan modellen die getraind waren met de traditionele methode van kunstmatige vervorming. De resultaten toonden aan dat door te vertrouwen op de natuurlijke gelijkenissen die in de echte data te vinden zijn in plaats op handmatig gemaakte trucjes, het model een robuustere en nauwkeurigere begrip van de deeltjesfysica ontwikkelde. Deze aanpak suggereert dat de toekomst van het trainen van deze krachtige instrumenten wellicht niet ligt in het verzinnen van nieuwe data, maar in het vinden van de verborgen connecties die al bestaan binnen de enorme hoeveelheden echte data die we hebben verzameld.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →