← Neueste Arbeiten
⚛️ high-energy experiments

A-GHOST: High-rate streaming of trigger-level data to programmable GPU inference

Dieses Papier präsentiert A-GHOST, ein Proof-of-Concept-System, das hochfrequente Trigger-Level-Daten von Detektoren an ein GPU-Backend unter Verwendung des NVIDIA IGX Thor Kits streamt und dabei einen dauerhaften Durchsatz von 100 Gbit/s mit einer Inferenzlatenz von 0,118 ms erreicht, um komplexe, generative neuronale Netzwerkalgorithmen jenseits der Fähigkeiten traditioneller Hardware-Trigger zu ermöglichen.

Ursprüngliche Autoren: I. Xiotidis, N. Clarke Hall, M. S. Larson, R. Gurunathan, C. Burdick, T. Du, N. Konstantinidis, K. Kordas, D. Leshchev, D. W. Miller, V. A. Petrovic, D. Sampsonidou, A. Thompson, T. Wengler

Veröffentlicht 2026-10-02
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: I. Xiotidis, N. Clarke Hall, M. S. Larson, R. Gurunathan, C. Burdick, T. Du, N. Konstantinidis, K. Kordas, D. Leshchev, D. W. Miller, V. A. Petrovic, D. Sampsonidou, A. Thompson, T. Wengler

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

In der Welt der Hochenergiephysik lassen Wissenschaftler Teilchen mit nahezu Lichtgeschwindigkeit aufeinanderprallen, um die fundamentalen Bausteine des Universums zu entschlüren. Diese Kollisionen geschehen mit einer solchen Heftigkeit und Häufigkeit, dass sie einen Datenstrom erzeugen, der viel zu gewaltig ist, um dauerhaft gespeichert zu werden. Um diesen Zustrom zu bewältigen, verlassen sich die Experimente auf ein ausgeklügeltes Filtersystem, das als Trigger bekannt ist. Dieses System fungiert als Torwächter und trifft in Bruchteilen von Sekunden Entscheidungen darüber, welche Kollisionsereignisse interessant genug sind, um behalten zu werden, und welche als belangloser Lärm verworfen werden sollen. Seit Jahrzehnten wird diese Gatekeeping-Aufgabe von spezialisierten elektronischen Schaltkreisen übernommen, die zwar unglaublich schnell, aber starr sind; sie müssen Entscheidungen innerhalb eines festen, winzigen Zeitfensters treffen und können nur einfache Berechnungen durchführen. Da die Experimente immer leistungsfähiger werden, wächst die von ihnen produzierte Datenmenge schneller, als diese starren Schaltkreise sie verarbeiten können, was einen Engpass schafft, durch den potenziell bahnbrechende Entdeckungen verloren gehen könnten, einfach weil das System nicht mithalten kann.

Ein Forscherteam hat nun einen neuen Weg demonstriert, um dieses Problem zu lösen, bei dem der schnelle, starre Torwächter beibehalten, aber direkt dahinter ein leistungsstarker, flexibler Assistent hinzugefügt wird. Ihre Arbeit, die unter dem Titel A-GHOST präsentiert wurde, untersucht eine Methode, bei der die initialen elektronischen Schaltkreise nicht nur entscheiden, was behalten werden soll, sondern stattdessen eine kompakte Zusammenfassung jeder Kollision an einen modernen Grafikprozessor streamen. Dieser Prozessor – derselbe Typ Chip, der in High-End-Computern für Gaming und künstliche Intelligenz zu finden ist – ist in der Lage, weitaus komplexere und kreativere Algorithmen auszuführen, als es die starren Schaltkreise bewältigen könnten. Durch die Verlagerung der schweren Analysearbeit auf diesen leistungsstarken Prozessor können Wissenschaftler Daten mit Raten analysieren, die zuvor unmöglich waren, was die Tür zur Detektion subtiler, seltener Phänomene öffnet, die die alten, einfacheren Systeme übersehen hätten.

Die Forscher bauten einen Prototyp, um diese Idee zu testen, wobei sie ein spezielles Entwicklungskit verwendeten, das für Hochleistungsrechnen konzipiert ist. Anstatt direkt mit den massiven Teilchendetektoren eines echten Experiments verbunden zu sein, erstellten sie eine kontrollierte Schleife, in der ein Softwareprogramm den Datenstrom simulierte, der von einer Teilchenkollision ausgeht. Dieser simulierte Strom wurde über ein Hochgeschwindigkeits-Netzwerkkabel gesendet und direkt in den Grafikprozessor eingespeist. Das System wurde so konzipiert, dass es die üblichen Computerschritte umgeht, die die Dinge verlangsamen würden, indem es die Daten direkt von der Netzwerkkarte in den Speicher des Prozessors leitet. Dies ermöglichte es dem Team zu sehen, ob der Prozessor mit den Daten Schritt halten konnte, während sie eintrafen, ohne dabei Informationen zu verlieren oder überfordert zu werden.

Um die Daten nutzbar zu machen, mussten die Forscher ein kniffliges Rätsel lösen. Die Daten kommen in kleinen, fragmentierten Paketen an, vergleichbar mit einzelnen Buchseiten, die nacheinander durch ein Fenster geworfen werden. Die Modelle der künstlichen Intelligenz, die zur Analyse der Daten verwendet werden, müssen jedoch die ganze Seite oder sogar ein ganzes Kapitel auf einmal sehen, um effektiv arbeiten zu können. Das Team schrieb ein spezielles Programm, das als schneller Assembler fungierte, der diese eingehenden Fragmente griff und sie im Moment ihres Eintreffens zu vollständigen, kontinuierlichen Datenblöcken zusammenfügte. Diese Montage geschah augenblicklich innerhalb des Prozessorspeichers, wodurch sichergestellt wurde, dass die Daten ohne Verzögerung und ohne den Umweg über den Hauptprozessor des Computers bereit für die Analyse waren.

Das Team testete dieses System mit drei verschiedenen Arten von Modellen der künstlichen Intelligenz, von denen jedes darauf ausgelegt war, ungewöhnliche Muster in den simulierten Kollisionsdaten zu erkennen. Ein Modell betrachtete einzelne Ereignisse, während die anderen über die Zeit hinweg Sequenzen von Ereignissen betrachtete, um komplexe, sich entwickelnde Anomalien zu finden. Sie trieben das System an seine Grenzen, indem sie Daten mit Geschwindigkeiten von 40 bis 100 Gigabit pro Sekunde sendeten. Bei der höchsten Geschwindigkeit empfing das System fast alle Daten, ohne ein einziges Paket zu verlieren. Die Modelle der künstlichen Intelligenz konnten die Daten mit einer Verzögerung von weniger als einem Zehntel Millisekunde analysieren – eine Geschwindigkeit, die für einen Einsatz in einem Reale-Zeit-Experiment praktikabel ist. Das System lief stundenlang ohne Ausfall und bewies damit, dass die Kombination aus Hochgeschwindigkeits-Vernetzung und leistungsstarker Grafikverarbeitung den massiven Informationsfluss moderner Physikexperimente bewältigen kann.

Was dieses Ergebnis signifikant macht, ist nicht nur die Geschwindigkeit, sondern die Flexibilität, die es bietet. Die starren Schaltkreise, die derzeit die Daten bewachen, können weiterhin ihre Aufgabe der zeitlichen Steuerung und der ersten Filterung erfüllen, müssen aber nicht länger das letzte Wort darüber haben, was interessant ist. Durch das Streaming einer kompakten Zusammenfassung der Daten an einen programmierbaren Prozessor können Wissenschaftler nun weita much anspruchsvollere Algorithmen ausführen, die in der Lage sind, Muster über mehrere Ereignisse hinweg zu erlernen oder komplexe generative Modelle zu nutzen, um Anomalien aufzuspüren. Dies sind Aufgaben, die für die aktuelle starre Hardware zu schwierig oder zu langsam sind. Die Studie zeigt, dass diese neue Architektur lebensfähig ist und einen Weg in die Zukunft eröffnet, in dem der Datenfluss niemals durch die Grenzen des Hardware-Triggers blockiert wird, sodass Physiker das Universum mit einem viel schärferen und anpassungsfähigeren Blick erforschen können.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →