← Nieuwste papers
⚛️ phenomenology

Towards Foundation Models on Hardware Accelerators for Particle Physics

Dit artikel toont aan dat kennisdistillatie van een groot fundamenteel model naar een efficiënt, aandachtvrij Deep Sets-netwerk de achtergrondonderdrukking voor real-time topquark-jet tagging op hardware-acceleratoren aanzienlijk verbetert, met name in het regime van lage signalefficiëntie dat cruciaal is voor collider-triggers.

Oorspronkelijke auteurs: Maya Benyas, Julia Gonski, Qibin Liu, P. Alex May, Vinicius Mikuni, Benjamin Nachman, Tanvi Wamorkar, Liangyu Wu

Gepubliceerd 2026-09-24
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Maya Benyas, Julia Gonski, Qibin Liu, P. Alex May, Vinicius Mikuni, Benjamin Nachman, Tanvi Wamorkar, Liangyu Wu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

In de hooggestoken wereld van de deeltjesfysica laten wetenschappers deeltjes met ongelooflijke snelheden op elkaar botsen om de fundamentele bouwstenen van het universum te ontdekken. Wanneer deze botsingen plaatsvinden, produceren ze sproeiers van kleinere deeltjes die zogenaamde 'jets' worden genoemd, die de vingerafdrukken van de oorspronkelijke gebeurtenis dragen. Om zin te kunnen geven aan de miljarden botsingen die elke seconde plaatsvinden, moeten detectoren onmiddellijk beslissen welke gebeurtenissen interessant genoeg zijn om later voor studie te bewaren en welke slechts achtergrondruis zijn. Deze beslissing vindt plaats in een fractie van een seconde, vaak binnen enkele microseconden, waardoor de hardware wordt gedwongen om vereenvoudigde, razendsnelle algoritmen uit te voeren. Echter, de krachtigste instrumenten voor het identificeren van deze jets zijn massieve computermodellen die veel te veel tijd en energie vereisen om te draaien binnen dergelijke strakke deadlines. De uitdaging was om het briljante, genuanceerde oordeel van deze gigantische modellen te vangen en hun kennis in minuscule, efficiënte netwerken te persen die kunnen draaien op de gespecialiseerde chips binnen de detectoren.

Een team van onderzoekers van Stanford University, SLAC National Accelerator Laboratory en andere instellingen heeft een belangrijke stap gezet naar het oplossen van dit probleem door een klein, eenvoudig netwerk te leren denken als een gigantische, vooraf getrainde expert. Ze begonnen met een massief "foundation model", een type kunstmatige intelligentie dat al had geleerd van meer dan een miljard gesimuleerde deeltjesjets over honderden verschillende scenario's. Dit gigantische model was uitzonderlijk goed in het identificeren van jets die afkomstig waren van top-quarks, een zwaar deeltje dat cruciaal is voor veel ontdekkingen in de natuurkunde, maar het was veel te groot om op de hardware te passen die wordt gebruikt voor real-time triggers. In plaats van te proberen het gigantische model direct te verkleinen, gebruikten de onderzoekers een techniek genaamd 'knowledge distillation'. Stel je een meesterleraar voor die een enorme bibliotheek aan boeken heeft bestudeerd en vervolgens gaat zitten om een student te begeleiden. De leraar geeft de student niet alleen de juiste antwoorden; in plaats daarvan deelt de leraar hun eigen interne redenering en betrouwbaarheidsniveaus voor elk voorbeeld. De student leert deze verfijnde manier van denken na te bootsen, waarbij de ervaring van de leraar wordt geabsorbeerd zonder de noodzaak te hebben om het volledige gewicht van de hele bibliotheek met zich mee te dragen.

De onderzoekers pasten deze methode toe om een "student"-netwerk te creëren gebaseerd op een eenvoudige architectuur bekend als Deep Sets, die is ontworpen om snel en efficiënt te zijn. Aanvankelijk was deze student een basisnetwerk dat elk deeltje in een jet onafhankelijk behandelde en de eigenschappen ervan gemiddeld om een beslissing te nemen. Hoewel deze aanpak snel was, miste het de subtiele relaties tussen deeltjes. Om de student te verbeteren, voegde het team een enkele laag toe die deeltjes de mogelijkheid gaf om informatie met elkaar uit te wisselen, vergelijkbaar met een groep mensen die een probleem bespreken voordat ze tot een consensus komen. Vervolgens trainden ze de verbeterde student met behulp van de zachte, genuanceerde voorspellingen van het gigantische foundation model, in plaats van alleen de standaard 'goed-of-fout'-labels. De resultaten waren opmerkelijk. De kleine student, die slechts een fractie van de parameters van de gigantische leraar bevat, bereikte prestatieniveaus die verrassend dicht bij het originele massieve model lagen. Specifiek werd de student veel beter in het afwijzen van achtergrondruis terwijl de zeldzame, interessante signalen behouden bleven, een cruciale vaardigheid voor triggersystemen die extreem selectief moeten zijn.

De studie onderzocht ook hoe de achtergrond van de leraar de student beïnvloedde. Wanneer de student werd getraind met een leraar die vóór de specifieke taak al op een enorme dataset was getraind, leerde de student veel effectiever ruis te filteren dan wanneer de student werd getraind door een leraar die alleen de specifieke taak vanaf nul had geleerd. Dit suggereert dat de brede ervaring verkregen van het foundation model succesvol is overgedragen naar het kleine netwerk. Verder testten de onderzoekers hoe goed deze kleine netwerken stand zouden houden als hun getallen vereenvoudigd zouden worden om op hardwarechips te passen, een proces dat bekend staat als kwantisatie. Wanneer ze simpelweg de getallen afrondden, daalde de prestatie aanzienlijk. Echter, door de netwerken er met deze vereenvoudiging in gedachten zorgvuldig opnieuw te trainen, herstelden ze bijna alle verloren nauwkeurigheid. De uiteindelijke modellen vereisten miljoenen malen minder berekeningen dan het oorspronkelijke gigantische model, wat ze levensvatbare kandidaten maakt voor de volgende generatie experimenten in de deeltjesfysica.

Dit werk demonstreert dat de buitengewone capaciteiten van massieve, vooraf getrainde AI-modellen kunnen worden gedestilleerd in compacte, efficiënte netwerken zonder hun meest waardevolle vaardigheden te verliezen. Door een eenvoudige architectuur te combineren met een 'message-passing' laag en de begeleiding van een foundation model, creëerden de onderzoekers een systeem dat zowel krachtig als praktisch is voor de strikte tijdsgrenzen van deeltjesfysica-triggers. De bevindingen suggereren dat toekomstige detectoren snellere en slimmere beslissingen in real-time kunnen nemen, wat potentieel de deur opent naar het ontdekken van nieuwe natuurkundige verschijnselen die voorheen verborgen waren in de ruis. De volgende stap voor het team is om deze netwerken direct op de hardwarechips te bouwen om hun snelheid en resourcegebruik te testen, waarmee ze de stap maken van simulatie naar de fysieke realiteit van de versneller.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →